دیپسیک پیش از عرضه مدل جدید هوش مصنوعی خود، رویکرد نوآورانهای را برای بهبود توانایی استدلال مدلهای زبانی بزرگ (LLM) معرفی کرده است. این شرکت در همکاری با پژوهشگران دانشگاه تسینگهوا، تکنیکی ترکیبی از دو روش با نامهای «مدلسازی پاداش مولد» (Generative Reward Modelling یا GRM) و «تنظیم انتقادی مبتنی بر اصول درونی» (Self-Principled Critique Tuning) را برای بهبود توان استدلال توسعه داده است.
به گزارش پیوست، بر اساس مقالهای که روز جمعه در پایگاه علمی آنلاین arXiv منتشر شده است، این رویکرد دوگانه به مدلهای زبانی کمک میکند تا پاسخهای دقیقتر و سریعتری به پرسشهای عمومی ارائه دهند. محققان در این مقاله نوشتند که مدلهای DeepSeek-GRM عملکردی رقابتی نسبت به سایر روشهای موجود نشان داده و توانستهاند به سطح عملکردی مشابه با مدلهای قدرتمند فعلی با پاداش عمومی دست پیدا کنند. مدلسازی پاداش به فرآیندی اطلاق میشود که یک مدل زبانی را در جهت ترجیحات انسانی هدایت میکند.
پژوهشگران میگویند قصد دارند مدلهای GRM را بهصورت متنباز منتشر کنند، اما زمانی برای این اقدام مشخص نکردهاند.
