از آنجایی که هوش مصنوعی در سنجههای موجود امتیازهای بسیار بالایی را کسب کرده است، شرکتهای هوش مصنوعی نحوه آزمایش و ارزیابی این مدلهای را تغییر میدهند. با این حال مشکلاتی پیش روی شرکتها است که از جمله آنها میتوان به نبود یک سنجه واحد برای ارزیابی مدلها اشاره کرد و همچنین به گفته فعالان این حوزه، سنجههای هوش مصنوعی پس از مدتی به دلیل تبدیل شدن به هدف برای شرکتها و مدلها، بازدهی و اعتبار خود را از دست میدهند.
به گزارش پیوست به نقل از فایننشال تایمز، اوپنایآی، مایکروسافت، متا و آنتروپیک همگی به تازگی از برنامههای خود برای ساخت عاملیتهای هوش مصنوعی خبر دادهاند، عاملیتهایی که میتوانند به صورت خودمختار کارهایی را به نیابت از انسان برعهده بگیرند. این سیستمها برای انجام درست کارها باید اقدامات پیچیدهتری را با تکیه بر استدلال و برنامهریزی به اجرا بگذارند.
شرکتها این ابزارهای هوش مصنوعی را با کمک کارکنان و پژوهشگران خارجی ارزیابی میکنند. این آزمونهای استاندارد که به عنوان سنجههای هوش مصنوعی شناخته میشوند، توانایی مدلها عملکرد سیستم شرکتهای مختلف یا نسخه قدیمی را ارزیابی میکنند.
