پژوهشگر ایرانی-آمریکایی MIT: مدل‌های بزرگ زبانی به جای فهم واقعی سوال به الگوهای دستوری وابسته‌اند

یک پژوهش جدید از موسسه فناوری ماساچوست (MIT) نشان می‌دهد مدل‌های زبانی بزرگ (LLMs) ممکن است به‌جای تکیه بر دانش واقعی، به شکلی نادرست روی الگوهای دستوری تکرارشونده در داده‌های آموزشی اتکا کنند؛ پدیده‌ای که دقت و اعتبار این ابزارها را در حوزه‌های حساس به‌شدت کاهش می‌دهد. رهبری این پژوهش را مرضیه قاسمی، استادیار ایرانی-آمریکایی دیپارتمان مهندسی برق و علوم کامپیوتر دانشگاه MIT برعهده داشت.

یک پژوهش جدید از موسسه فناوری ماساچوست (MIT) نشان می‌دهد مدل‌های زبانی بزرگ (LLMs) ممکن است به‌جای تکیه بر دانش واقعی، به شکلی نادرست روی الگوهای دستوری تکرارشونده در داده‌های آموزشی اتکا کنند؛ پدیده‌ای که دقت و اعتبار این ابزارها را در حوزه‌های حساس به‌شدت کاهش می‌دهد. رهبری این پژوهش را مرضیه قاسمی، استادیار ایرانی-آمریکایی دیپارتمان مهندسی برق و علوم کامپیوتر دانشگاه MIT برعهده داشت.

به گزارش پیوست، به گفته قاسمی یک مدل بزرگ زبانی در پاسخ به سوال به جای بررسی و جستجو در دانش مربوط به آن حوزه، از الگو‌های گرامری و نحوی استفاده می‌کند که در طول آموزش یاد گرفته است. این مساله باعث می‌شود مدل در کاربرد‌های جدید به طور غیرمنتظره‌ای به مشکل بخورد و در واقع قالب‌های نحوی را در اولویت قرار دهد، حتی اگر درکی از معنا نداشته باشد.

طبق این پژوهش مدل‌ها صرفا به دلیل تشابه ساختار دستوری سوال با الگوهایی که در داده‌های یک حوزه خاص دیده‌اند اقدام به ارائه پاسخ می‌کنند و پرسش بی‌معنا یا مربوط به حوزه‌ای متفاوت را نیز به همین روش پاسخ می‌دهند. پژوهشگران می‌گویند این رفتار حتی در مدل‌های پیشرفته‌ای مانند GPT-4 و Llama مشاهده شده است.

منبع  : ماهنامه پیوست

برای مشاهده کامل مطلب کلیک کنید

اشتراک‌گذاری

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *