تفاوت فاحش میان ارزیابی‌های مستقل مدل o3 و بررسی‌های اوپن‌ای‌آی

مدل هوش مصنوعی جدید شرکت اوپن‌ای‌آی با نام «o3» که به تازگی از سوی این شرکت معرفی شده است، از لحاظ عملکردی در ارزیابی‌های مستقل اختلاف فاحشی با بررسی‌های داخلی شرکت دارد. این شرکت در زمان معرفی مدل در ماه دسامبر مدعی شده بود که این مدل توانسته بیش از یک‌چهارم از مسائل مجموعه FrontierMath را که یک مجموعه از مسائل دشوار ریاضی برای ارزیابی توان استدلالی مدل‌ها است، را حل کند. با این حال بررسی‌های مستقل رقم‌های‌متفاوتی را گزارش کرده‌‌اند.

مدل هوش مصنوعی جدید شرکت اوپن‌ای‌آی با نام «o3» که به تازگی از سوی این شرکت معرفی شده است، از لحاظ عملکردی در ارزیابی‌های مستقل اختلاف فاحشی با بررسی‌های داخلی شرکت دارد. این شرکت در زمان معرفی مدل در ماه دسامبر مدعی شده بود که این مدل توانسته بیش از یک‌چهارم از مسائل مجموعه FrontierMath را که یک مجموعه از مسائل دشوار ریاضی برای ارزیابی توان استدلالی مدل‌ها است، را حل کند. با این حال بررسی‌های مستقل رقم‌های‌متفاوتی را گزارش کرده‌‌اند.

به گزارش پیوست به نقل از تک‌کرانچ، رقم ادعایی اوپن‌ای‌آی به‌طور چشمگیری از نزدیک‌ترین رقیب خود که تنها حدود ۲ درصد از مسائل را پاسخ داده بود، نیز جلوتر بود. مارک چن، مدیر ارشد تحقیقات اوپن‌ای‌آی، در جریان یک پخش زنده اعلام کرد: «در حال حاضر، تمامی مدل‌های موجود کمتر از ۲ را حل می‌کنند. ما در ارزیابی‌های داخلی و در حالت استفاده از توان پردازشی شدید، به عملکردی بیش از ۲۵٪ با مدل o3 رسیده‌ایم.»

اما به‌نظر می‌رسد این عملکرد خیره‌کننده، به نسخه‌ای از مدل مربوط می‌شود که در شرایطی با توان پردازشی بالا مورد آزمایش قرار گرفته و نه به نسخه‌ای که اخیرا برای عموم منتشر شده است. مؤسسه تحقیقاتی Epoch AI که مسئول توسعه مجموعه FrontierMath است، نتایج آزمون‌های مستقل خود از مدل o3 را منتشر کرده و می‌گوید این مدل تنها حدود ۱۰ از مسائل را حل کرده است.

منبع  : ماهنامه پیوست

برای مشاهده کامل مطلب کلیک کنید

اشتراک‌گذاری

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *