مدل هوش مصنوعی جدید شرکت اوپنایآی با نام «o3» که به تازگی از سوی این شرکت معرفی شده است، از لحاظ عملکردی در ارزیابیهای مستقل اختلاف فاحشی با بررسیهای داخلی شرکت دارد. این شرکت در زمان معرفی مدل در ماه دسامبر مدعی شده بود که این مدل توانسته بیش از یکچهارم از مسائل مجموعه FrontierMath را که یک مجموعه از مسائل دشوار ریاضی برای ارزیابی توان استدلالی مدلها است، را حل کند. با این حال بررسیهای مستقل رقمهایمتفاوتی را گزارش کردهاند.
به گزارش پیوست به نقل از تککرانچ، رقم ادعایی اوپنایآی بهطور چشمگیری از نزدیکترین رقیب خود که تنها حدود ۲ درصد از مسائل را پاسخ داده بود، نیز جلوتر بود. مارک چن، مدیر ارشد تحقیقات اوپنایآی، در جریان یک پخش زنده اعلام کرد: «در حال حاضر، تمامی مدلهای موجود کمتر از ۲ را حل میکنند. ما در ارزیابیهای داخلی و در حالت استفاده از توان پردازشی شدید، به عملکردی بیش از ۲۵٪ با مدل o3 رسیدهایم.»
اما بهنظر میرسد این عملکرد خیرهکننده، به نسخهای از مدل مربوط میشود که در شرایطی با توان پردازشی بالا مورد آزمایش قرار گرفته و نه به نسخهای که اخیرا برای عموم منتشر شده است. مؤسسه تحقیقاتی Epoch AI که مسئول توسعه مجموعه FrontierMath است، نتایج آزمونهای مستقل خود از مدل o3 را منتشر کرده و میگوید این مدل تنها حدود ۱۰ از مسائل را حل کرده است.
