پس از عرضه ChatGPT در سال ۲۰۲۲ و شهرت جهانی هوش مصنوعی مولد، به تدریج ابزارهای مولد از متن به سمت دیگر رسانههای دیجیتال از جمله تصویر، صوت و ویدیو حرکت کردند. در حال حاضر ابزارهای قدرتمندی برای تولید ویدیو و تصویر از سوی شرکتهای پیشتاز عرضه شده و تصور تولید یک کلیپ سینمایی تنها با یک دستور متنی که سالها پیش در تصور کسی نمیگنجید، امروز تا حد زیادی پیشرفت کرده است.
ابزارهایی قدرتمندی همچون سورا از اوپنایآی، Veo 3 از از دیپمایند گوگل و Gen-4 از Runway حالا میتوانند ویدیوهایی تولید کنند که شاید بهسختی بتوان آنها را از فیلمبرداری واقعی یا انیمیشنهای CGI تمایز داد. اما پرسش اینجاست که این مدلهای قدرتمند چگونه به چنین سطحی از کیفیت رسیدهاند و چطور این خروجی با کیفیت را تولید میکنند؟
