شرکت متا که به عنوان پیشتاز مدلهای متنباز در جهان شناخته میشود از یک مدل زبانی جدید به نام روح یا Spirit LM رونمایی کرده است که امکان تولید و درک چند وجهی و با رویکرد تازهای به بهبود روند درک و تولید گفتار در هوش مصنوعی کمک میکند. جامعه علمی میتواند از این مدل و مشتقات آن برای اهداف پژوهشی و غیرتجاری استفاده کنند.
به گزارش پیوست به نقل از ونچربیت، این مدل زبانی میتواند در ورودی و خروجی خود از تلفیق متن و صوت پشتیبانی کند و از این رو در رقابت با GPT-4o (که از ابتدا امکان فعالیت چندوجهی داشت) و دیگر مدلهای مشابه مثل EVI 2 از شرکت Hume قرار میگیرد.
این مدل که توسط تیم تحقیقات بنیادین هوش مصنوعی (FAIR) در شرکت متا طراحی شده است، به دنبال رفع خلا موجود در تجربه هوش مصنوعی صوتی و تولید گفتار جذاب و طبیعی است و همچنین یادگیری وظایفی در حوزههای مختلف از جمله تشخیص بیان خودکار (ASR)، متن به گفتار (TTS) و دستهبندی گفتار است.
