سهشنبه 22 مهر 1404 – 13:40 – بهروزشده در شنبه 26 مهر 1404 – 05:47
پژوهشگران اپل، مدل انتشارمحور (diffusion model) جدیدی معرفی کردهاند که میتواند متن را تا 128 برابر سریعتر از مدلهای زبانی مشابه تولید کند.
به گزارش تکناک، مدلهای زبانی بزرگ (LLM) مانند ChatGPT از نوع خودرگرسیو هستند، یعنی متن را توکن به توکن و به صورت متوالی تولید میکنند و هر مرحله تولید به توکنهای قبلی و درخواست کاربر وابسته است. این روند باعث میشود که تولید متن طولانی، زمانبر باشد و سرعت پردازش محدود شود. برخلاف مدلهای خودرگرسیو، مدلهای انتشارمحور قادر هستند چندین توکن را به طور همزمان تولید کنند و آنها را طی چند مرحله تکراری اصلاح نمایند تا پاسخ نهایی شکل گیرد. این قابلیت باعث میشود که سرعت تولید متن به طرز چشمگیری افزایش یابد. یکی از انواع مدلهای انتشارمحور، مدلهای flow-matching است. این مدلها در عمل، مراحل تکراری مدلهای انتشارمحور را کنار میگذارند و یاد میگیرند که نتیجه نهایی را یکباره تولید کنند. نتیجه، تولید متن طولانی با سرعتی بیسابقه است. برای علاقهمندان به جزئیات فنی، اپل منابعی درباره مدل انتشارمحور برای کدنویسی و مدل flow-matching برای تا شدن پروتئین منتشر کرده است. این منابع نشان میدهند که چگونه مدلهای زبانی جدید اپل میتوانند تولید متن طولانی را با سرعت و دقت بالا ممکن سازند.
برای مشاهده کامل مطب کلیک کنید
