شنبه 5 اردیبهشت 1405 – 09:25
سرویس هوش مصنوعی تکناک
برخلاف مدلهای قبلی که کاربران باید مراحل مختلف کار را به صورت دستی در قالب پرامپت هدایت میکردند، خود این مدل جدید میتواند برنامهریزی کند، از ابزارها استفاده نماید، خروجیهای خود را بررسی کند و تا رسیدن به هدف مورد نظر به کار ادامه دهد. با وجود این جهش در تواناییها، OpenAI بیان کرد که GPT-5.5 در استفاده واقعی، همان میزان تأخیر به ازای هر توکن را مانند GPT‑5.4 حفظ کرده است و در عین حال برای انجام همان وظایف در Codex به تعداد توکن کمتری نیاز دارد.
در شاخص GDPval که توانایی عاملها را در انجام کارهای دانشی دقیق در 44 شغل مختلف اندازهگیری میکند، مدل GPT-5.5 امتیاز 84.9 درصد را ثبت کرده است. این مدل در آزمون OSWorld‑Verified که میزان توانایی استفاده خودکار از رایانه در محیطهای واقعی را میسنجد نیز امتیاز 78.7 درصد کسب کرد. همچنین در آزمون Tau2‑bench Telecom که برای ارزیابی گردشکارهای پیچیده خدمات مشتریان طراحی شده است، GPT-5.5 بدون نیاز به تنظیم پرامپت به امتیاز 98 درصد دست یافت.
برای مشاهده کامل مطب کلیک کنید
