سهشنبه 15 اردیبهشت 1405 – 12:55
سرویس هوش مصنوعی تکناک
مرکز CAISI (Center for AI Standards and Innovation)، زیرمجموعه NIST، در تاریخ ۱ مه ارزیابی خود را از مدل DeepSeek V4 Pro منتشر کرد. جمعبندی این گزارش نشان میدهد که مدل متنباز پرچمدار دیپسیک در حدود ۸ ماه از مدلهای هوش مصنوعی آمریکا عقبتر است؛ هرچند همین نهاد آن را قدرتمندترین مدل چینی ارزیابیشده تا امروز معرفی کرده است. نکته متمایز در رویکرد CAISI، عدم استفاده از میانگین ساده بنچمارکها است. این نهاد به جای آن از روش “Item Response Theory (IRT)” استفاده میکند؛ یک چارچوب آماری برگرفته از آزمونهای استاندارد که توانایی پنهان مدل را از طریق الگوی موفقیت و شکست در حل مسائل مختلف تخمین میزند. این مقایسه هوش مصنوعی بر پایه ۹ بنچمارک در ۵ حوزه شامل امنیت سایبری، مهندسی نرمافزار، علوم طبیعی، استدلال انتزاعی و ریاضیات انجام شده است.
برای مشاهده کامل مطب کلیک کنید
