جمعه 13 تیر 1404 – 19:25
درحالحاضر، این قابلیت در مرحله تحقیقوتوسعه قرار دارد و هنوز وارد اپلیکیشن Character.AI نشده است. بااینحال، مقاله علمی مربوط به این پروژه همراه با ویدئوهای نمایشی منتشر شده است که نشان میدهد این فناوری چه ظرفیتهای بزرگی برای آینده دارد.
همچنین، Audio-Driven Cross Attention کمک میکند تا مدل نهتنها کلمات، بلکه لحن و مکث و ریتم گفتار را تحلیل کند و بهصورت دقیق در حرکات لب و سر و چشمها بازتاب دهد. Sparse Causal Attention نیز باعث بهینهسازی هزینه پردازش ویدئو میشود و Asymmetric Distillation امکان تولید ویدئو در زمان واقعی را فراهم میکند.
برای مشاهده کامل مطب کلیک کنید
