زمانی که شرکت اوپنایآی در دسامبر ۲۰۲۴ از ابزار مولد ویدیو خود با نام سورا (Sora) رونمایی کرد، بسیاری آن را نقطه عطفی در تاریخ فناوری دانستند و علاوه بر هیجان مخاطبان، نگرانیهای بسیاری را درمورد این ابزار و تبعات احتمالی آن برای صنعت سرگرمی و حتی سو استفاده از این ابزار شاهد بودیم.
به گزارش پیوست، هوش مصنوعی سورا میتواند ویدئوهایی با کیفیت بالا تولید کند که بهسادگی بخشهایی از فیلمهای سینمایی، سریالهای تلویزیونی و حتی لوگوی استودیوهای بزرگ را بازسازی میکند. چنین قابلیتی بهسرعت توجه هنرمندان، استودیوهای فیلمسازی، شرکتهای فناوری و سیاستگذاران را به خود جلب کرد. اما در دل این شگفتی، پرسشی جدی مطرح شد: سورا بر اساس چه دادههایی آموزش دیده است؟
اوپنایآی مانند بسیاری از شرکتهای دیگر اعلام کرده است که دادههای مورد استفاده ترکیبی از «منابع عمومی و دادههای دارای مجوز» هستند. اما همانطور که تجربه ChatGPT نشان داد، این عبارت میتواند طیف وسیعی از منابع اینترنتی را شامل شود؛ منابعی که در بسیاری از موارد بدون رضایت تولیدکنندگان محتوا جمعآوری شده است.
