یکشنبه 5 اسفند 1403 – 15:00
تکناک
استارتآپ xAI در وبلاگ رسمی خود نموداری منتشر کرد که عملکرد Grok 3 را در آزمون ریاضی AIME 2025 به نمایش میگذاشت. برخی متخصصان، اعتبار این آزمون را به عنوان یک معیار سنجش هوش مصنوعی زیر سؤال بردهاند، با وجود این، AIME 2025 و نسخههای پیشین آن اغلب برای ارزیابی توانایی ریاضی مدلها به کار میروند.
اما “cons@64” چیست؟ این معیار که مخفف “consensus@64” است، به مدل اجازه میدهد 64 بار به هر سؤال پاسخ دهد و در نهایت، پرتکرارترین پاسخ را به عنوان جواب نهایی در نظر میگیرد. این روش اغلب باعث افزایش چشمگیر امتیاز مدلها در بنچمارکها میشود. حذف این معیار از نمودار میتواند این تصور را ایجاد کند که یک مدل از مدل دیگر برتر است، در حالی که در عمل اینگونه نیست.
برای مشاهده کامل مطب کلیک کنید
