یکشنبه 23 آذر 1404 – 11:50
سرویس هوش مصنوعی FACTS Benchmark Suite
این معیارها مدلها را در چهار حوزه مورد آزمایش قرار میدهند، که شامل پاسخ به سؤالات واقعی از دانش داخلی، استفاده مؤثر از جستوجوی وب، مبنا قرار دادن پاسخها در اسناد طولانی و تفسیر تصاویر میشوند. بهترین مدل مورد آزمایش، یعنی Gemini 3 Pro متعلق به گوگل، به دقت ۶۹ درصد دست یافت و سایر مدلهای پیشرو عملکردی پایینتر از این میزان داشتند.
برای مشاهده کامل مطب کلیک کنید
