دیپ‌سیک از رویکرد جدیدی برای بهبود توانایی مدل‌های استدلال‌گر رونمایی کرد

دیپ‌سیک پیش از عرضه مدل جدید هوش مصنوعی خود، رویکرد نوآورانه‌ای را برای بهبود توانایی استدلال مدل‌های زبانی بزرگ (LLM) معرفی کرده است. این شرکت در همکاری با پژوهشگران دانشگاه تسینگ‌هوا، تکنیکی ترکیبی از دو روش با نام‌های «مدل‌سازی پاداش مولد» (Generative Reward Modelling یا GRM) و «تنظیم انتقادی مبتنی بر اصول درونی» (Self-Principled Critique Tuning) را برای بهبود توان استدلال توسعه داده است.

دیپ‌سیک پیش از عرضه مدل جدید هوش مصنوعی خود، رویکرد نوآورانه‌ای را برای بهبود توانایی استدلال مدل‌های زبانی بزرگ (LLM) معرفی کرده است. این شرکت در همکاری با پژوهشگران دانشگاه تسینگ‌هوا، تکنیکی ترکیبی از دو روش با نام‌های «مدل‌سازی پاداش مولد» (Generative Reward Modelling یا GRM) و «تنظیم انتقادی مبتنی بر اصول درونی» (Self-Principled Critique Tuning) را برای بهبود توان استدلال توسعه داده است.

به گزارش پیوست، بر اساس مقاله‌ای که روز جمعه در پایگاه علمی آنلاین arXiv منتشر شده است، این رویکرد دوگانه به مدل‌های زبانی کمک می‌کند تا پاسخ‌های دقیق‌تر و سریع‌تری به پرسش‌های عمومی ارائه دهند. محققان در این مقاله نوشتند که مدل‌های DeepSeek-GRM عملکردی رقابتی نسبت به سایر روش‌های موجود نشان داده و توانسته‌اند به سطح عملکردی مشابه با مدل‌های قدرتمند فعلی با پاداش عمومی دست پیدا کنند. مدل‌سازی پاداش به فرآیندی اطلاق می‌شود که یک مدل زبانی را در جهت ترجیحات انسانی هدایت می‌کند.

پژوهشگران می‌گویند قصد دارند مدل‌های GRM را به‌صورت متن‌باز منتشر کنند، اما زمانی برای این اقدام مشخص نکرده‌اند.

منبع  : ماهنامه پیوست

برای مشاهده کامل مطلب کلیک کنید

اشتراک‌گذاری

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *