مرکز تحقیقات هوش مصنوعی پارت و آزمایشگاه پردازش زبان طبیعی دانشگاه صنعتی امیرکبیر سیستم جامعی برای ارزیابی LLMهای فارسی (Open Persian LLM Leaderboard) و امکان مقایسه مدلهای زبانی فارسی را با هدف افزایش اعتبار این مدلهای زبانی توسعه دادهاند.
به گزارش روابط عمومی مرکز تحقیقات هوش مصنوعی پارت، مدلهای زبانی فارسی متنوعی از جانب شرکتهای فعال در حوزه هوش مصنوعی در دسترس کاربران و توسعهدهندگان قرار گرفتهاند. این LLMها اما تا زمانی که توسط سنجههای معتبر مورد ارزیابی قرار نگیرند، کیفیت عملکرد آنها مشخص نمیشود و مورد اعتماد اکوسیستم هوش مصنوعی قرار نمیگیرند.
یکی از چالشهای اساسی زیستبوم هوش مصنوعی کشور، موانعی است که بر سر راه سنجش مدلهای زبانی فارسی وجود دارد. سنجههای مشهور و معتبر خارجی، پشتیبانی مناسبی از زبان فارسی ندارند و سنجههای بومی که تاکنون عرضه شدند نیز جامعیت لازم را برای ارزیابی مدلها نداشتند، از همین رو، نتیجه ارزیابی LLMهای فارسی از اعتبار کافی برخوردار نبود و امکان مقایسه موشکافانه آنها وجود نداشت.
