رتبه بندی مدلهای هوش مصنوعی/ برتری کلود در متن و اوپن ای آی در تصویر – ایده روز آنلاین | اخبار ایران و جهان

به گزارش خبرنگار مهر؛ داده‌های تازه وبگاه «Arena.ai» تصویری چندقطبی از مرز فناوری ترسیم می‌کنند. بر همین اساس، آنتروپیک در متن، کدنویسی و عامل‌های هوشمند موقعیتی برجسته دارد، اوپن‌ای‌آی در تولید و ویرایش تصویر فاصله معناداری با رقبا ایجاد کرده، گوگل حوزه تولید ویدئو را در اختیار گرفته و بازیگران چینی مانند مون‌شات، علی‌بابا، «Z.ai»، بایت‌دنس و مینی‌مکس در بخش‌هایی از مرز عملکرد، مستقیماً با آزمایشگاه‌های آمریکایی رقابت می‌کنند.

به گزارش خبرنگار مهر؛ داده‌های تازه وبگاه «Arena.ai» تصویری چندقطبی از مرز فناوری ترسیم می‌کنند. بر همین اساس، آنتروپیک در متن، کدنویسی و عامل‌های هوشمند موقعیتی برجسته دارد، اوپن‌ای‌آی در تولید و ویرایش تصویر فاصله معناداری با رقبا ایجاد کرده، گوگل حوزه تولید ویدئو را در اختیار گرفته و بازیگران چینی مانند مون‌شات، علی‌بابا، «Z.ai»، بایت‌دنس و مینی‌مکس در بخش‌هایی از مرز عملکرد، مستقیماً با آزمایشگاه‌های آمریکایی رقابت می‌کنند.

اهمیت بنچمارک «Arena.ai» از روش ارزیابی آن ناشی می‌شود. رتبه‌بندی‌های اصلی این پلتفرم بر مقایسه‌های دوبه‌دوی پاسخ مدل‌ها و ترجیح کاربران واقعی بنا شده‌اند و امتیازها با مدل آماری مدل بردلی-تری محاسبه می‌شوند. «Arena.ai» در کنار رتبه خام، «بازه رتبه» را نیز منتشر می‌کند تا عدم قطعیت آماری آشکار بماند. بنابراین تفاوت چند امتیازی میان دو مدل الزاماً به معنای برتری قطعی یکی بر دیگری نیست. «Arena.ai» در سال ۲۰۲۶ شاخص «factuality» را نیز به «Text» و «Search» افزود که با استخراج و راستی‌آزمایی ادعاهای قابل بررسی، صحت پاسخ را در کنار ترجیح انسانی اندازه‌گیری می‌کند.

منبع  : پایگاه خبری ایده روز انلاین

برای مشاهده کامل مطلب کلیک کنید

اشتراک‌گذاری

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *