پنجشنبه 17 مهر 1404 – 12:35
تکناک
این مدل تنها ۷ میلیون پارامتر دارد، اما توانسته است در برخی از دشوارترین آزمونهای استدلالی، عملکردی مشابه یا حتی بالاتر از مدلهای غولپیکری مانند: OpenAI o3-mini و Google Gemini 2.5 Pro ارائه دهد. الکسا ژولیکور-مارتینو، پژوهشگر مؤسسه تحقیقات پیشرفته سامسونگ (SAIT) در مونترال، هدف از توسعه این مدل را اثبات این نکته دانست که میتوان با منابع محدود نیز به هوشی محاسباتی دست یافت که توانایی رقابت با مدلهای چند تریلیون پارامتری را داشته باشد. او در پستی در شبکه اجتماعی X نوشت: «باور به اینکه تنها مدلهای عظیم با بودجههای میلیون دلاری قادر به حل مسائل پیچیده هستند، اشتباهی بزرگ است. تمرکز بیش از اندازه بر استفاده از مدلهای زبانی بزرگ، نوآوری را محدود کرده است. باید به جای بهرهبرداری بیپایان از مدلهای آماده، به سراغ خلق روشهای تازه رفت.»
راز موفقیت TRM در طراحی مینیمالیستی آن نهفته است. ژولیکور-مارتینو در مصاحبهای اشاره کرده است که هرچه مدل را پیچیدهتر و پرلایهتر کرده، دقت و توانایی تعمیم آن کاهش یافته است. مدلهای بزرگ به سرعت دچار بیشبرازش میشوند، بهویژه وقتی دادههای آموزشی محدود باشد. در مقابل، ساختار ساده دولایه به همراه نظارت عمیق و بازگشتپذیری، تعادلی میان کارایی و دقت ایجاد کرده است. نکته جالب دیگر این است که در برخی وظایف کوچک مانند: حل Sudoku، حذف مکانیزم خودتوجهی و جایگزینی آن با پرسپترون چندلایه باعث بهبود عملکرد شده است، در حالی که برای وظایف پیچیدهتر و شبکهای بزرگتر مثل ARC-AGI، استفاده از self-attention همچنان ضروری بوده است. این یافتهها نشان میدهد که معماری بهینه مدل باید متناسب با ساختار دادهها باشد و صرفاً بر اساس افزایش ظرفیت نباشد.
برای مشاهده کامل مطب کلیک کنید
