با اشباع آزمونهای سنتی و احتمال آلودگی دادههای آموزشی، روشهای قدیمی سنجش توانایی مدلهای هوش مصنوعی دیگر نمیتوانند تصویر دقیقی از قدرت استدلال آنها ارائ... با اشباع آزمونهای سنتی و احتمال آلودگی دادههای آموزشی، روشهای قدیمی سنجش توانایی مدلهای هوش مصنوعی دیگر نمیتوانند تصویر دقیقی از قدرت استدلال آنها ارائه دهند. به همین دلیل، بنچمارکهای جدیدی برای ارزیابی توانایی حل مسئله، استدلال علمی، برنامهنویسی و هوش سیال مدلها در شرایط واقعی و ناشناخته مورد توجه قرار گرفتهاند. در این گزارش آناتک، نگاهی دقیق به مهمترین بنچمارکهای جدید و معیارهای نوین ارزیابی هوش مصنوعی خواهیم داشت.