جمعه 4 مهر 1404 – 22:15 – بهروزشده در شنبه 5 مهر 1404 – 06:38
سالهاست که معیارهای هوش مصنوعی نتوانستهاند آنچه کاربران در عمل از این سیستمها انتظار دارند، بهدرستی منعکس کنند. بیشتر آزمونها همچنان بر پرسش و پاسخهای انگلیسیمحور تمرکز دارند که هرچند مرتب به نظر میرسند، تنوع فعالیتهای کاری روزمره را نشان نمیدهند. TRUEBench با نام کامل Trustworthy Real-world Usage Evaluation Benchmark پا را فراتر گذاشته و عملکرد مدلها را در کارهایی همچون خلاصهسازی اسناد، ترجمه در دوازده زبان، تحلیل داده و اجرای دستورالعملهای چندمرحلهایمیسنجد که نیازمند حفظ بافت گفتوگو هستند.
برای مشاهده کامل مطب کلیک کنید
