متا از یک مدل متن‌باز با امکان تولید و درک محتوای صوتی و متنی برای استفاده غیرتجاری رونمایی کرد

شرکت متا که به عنوان پیشتاز مدل‌های متن‌باز در جهان شناخته می‌شود از یک مدل زبانی جدید به نام روح یا Spirit LM رونمایی کرده است که امکان تولید و درک چند وجهی و با رویکرد تازه‌ای به بهبود روند درک و تولید گفتار در هوش مصنوعی کمک می‌کند. جامعه علمی می‌تواند از این مدل و مشتقات آن برای اهداف پژوهشی و غیرتجاری استفاده کنند.

شرکت متا که به عنوان پیشتاز مدل‌های متن‌باز در جهان شناخته می‌شود از یک مدل زبانی جدید به نام روح یا Spirit LM رونمایی کرده است که امکان تولید و درک چند وجهی و با رویکرد تازه‌ای به بهبود روند درک و تولید گفتار در هوش مصنوعی کمک می‌کند. جامعه علمی می‌تواند از این مدل و مشتقات آن برای اهداف پژوهشی و غیرتجاری استفاده کنند.

به گزارش پیوست به نقل از ونچربیت، این مدل زبانی می‌تواند در ورودی و خروجی خود از تلفیق متن و صوت پشتیبانی کند و از این رو در رقابت با GPT-4o (که از ابتدا امکان فعالیت چندوجهی داشت) و دیگر مدل‌های مشابه مثل EVI 2 از شرکت Hume قرار می‌گیرد.

این مدل که توسط تیم تحقیقات بنیادین هوش مصنوعی (FAIR) در شرکت‌ متا طراحی شده است، به دنبال رفع خلا موجود در تجربه هوش مصنوعی صوتی و تولید گفتار جذاب و طبیعی است و همچنین یادگیری وظایفی در حوزه‌های مختلف از جمله تشخیص بیان خودکار (ASR)، متن به گفتار (TTS) و دسته‌بندی گفتار است.

منبع  : ماهنامه پیوست

برای مشاهده کامل مطلب کلیک کنید

اشتراک‌گذاری

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *