دوشنبه 1 اردیبهشت 1404 – 11:40
تکناک
مارک چن، مدیر ارشد تحقیقات OpenAI، در جریان یک پخش زنده گفته بود: «در حال حاضر، همه مدلهای موجود کمتر از ۲ درصد امتیاز دارند. اما ما در محیطهای آزمایشی داخلی و با استفاده از توان محاسباتی بالا، توانستهایم با o3 به بیش از ۲۵ درصد دست یابیم.»
البته این موضوع لزوماً به معنای ارائه اطلاعات نادرست توسط OpenAI نیست. نتایج اولیه این شرکت شامل بازهای از امتیازات بودند که رقم پایینتر آن با ارزیابی Epoch مطابقت دارد. خود Epoch نیز تأکید کرده که ممکن است تفاوت در نسخه سوالات و محیط آزمایش، دلیل این اختلاف باشد. به عنوان نمونه، OpenAI ممکن است از نسخهای خاصتر از سوالات FrontierMath یا از زیرساخت داخلی قدرتمندتری بهره برده باشد.
برای مشاهده کامل مطب کلیک کنید
