یک پژوهش جدید از موسسه فناوری ماساچوست (MIT) نشان میدهد مدلهای زبانی بزرگ (LLMs) ممکن است بهجای تکیه بر دانش واقعی، به شکلی نادرست روی الگوهای دستوری تکرارشونده در دادههای آموزشی اتکا کنند؛ پدیدهای که دقت و اعتبار این ابزارها را در حوزههای حساس بهشدت کاهش میدهد. رهبری این پژوهش را مرضیه قاسمی، استادیار ایرانی-آمریکایی دیپارتمان مهندسی برق و علوم کامپیوتر دانشگاه MIT برعهده داشت.
به گزارش پیوست، به گفته قاسمی یک مدل بزرگ زبانی در پاسخ به سوال به جای بررسی و جستجو در دانش مربوط به آن حوزه، از الگوهای گرامری و نحوی استفاده میکند که در طول آموزش یاد گرفته است. این مساله باعث میشود مدل در کاربردهای جدید به طور غیرمنتظرهای به مشکل بخورد و در واقع قالبهای نحوی را در اولویت قرار دهد، حتی اگر درکی از معنا نداشته باشد.
طبق این پژوهش مدلها صرفا به دلیل تشابه ساختار دستوری سوال با الگوهایی که در دادههای یک حوزه خاص دیدهاند اقدام به ارائه پاسخ میکنند و پرسش بیمعنا یا مربوط به حوزهای متفاوت را نیز به همین روش پاسخ میدهند. پژوهشگران میگویند این رفتار حتی در مدلهای پیشرفتهای مانند GPT-4 و Llama مشاهده شده است.
