
به گزارش مجله خبری نگار/آنا، تا چند سال پیش، سنجش توانایی یک مدل زبانی بزرگ تا حد زیادی به آزمونهایی مانند MMLU و HumanEval وابسته بود. مدلها در این آزمونها با مجموعهای از پرسشهای علمی، ریاضی، عمومی یا برنامهنویسی مواجه میشدند و امتیاز نهایی آنها برای مقایسه عملکرد مدلهای مختلف مورد استفاده قرار میگرفت. این روشها در زمان خود بسیار کاربردی بودند، اما رشد سریع مدلهای هوش مصنوعی باعث شده است محدودیتهای آنها بیشتر نمایان شود. مدلهای جدید در بسیاری از آزمونهای شناختهشده به امتیازهای بسیار بالا رسیدهاند و در نتیجه، تفاوت میان مدلهای قدرتمند بهسختی قابل تشخیص است. از سوی دیگر، احتمال وجود سوالات بنچمارکها در دادههای آموزشی مدلها باعث شده مشخص نباشد یک مدل واقعاً مسئله را حل کرده یا پاسخ آن را به شکل مستقیم یا غیرمستقیم از دادههای آموزشی یاد گرفته است.
