بهبود مدل‌های زبانی بزرگ با روش ساده اپل

سه‌شنبه 4 شهریور 1404 – 10:50 – به‌روزشده در چهارشنبه 5 شهریور 1404 – 07:01بهبود مدل‌های زبانی بزرگ با روش ساده اپل

پس از آموزش اولیه مدل‌های زبانی، کیفیت آنها با مرحله‌ای تحت عنوان «یادگیری تقویتی با بازخورد انسانی» (RLHF) بهبود می‌یابد. در این فرایند، بر اساس تأیید یا رد پاسخ‌ها توسط برچسب‌گذاران انسانی، مدل برای ارائه خروجی‌های بهتر آموزش داده می‌شود. این مرحله بخشی از فرایند گسترده‌تری به نام «هم‌راستاسازی» است، که هدف آن اطمینان از رفتار ایمن و مفید مدل‌ها می‌باشد.

منبع  : تک ناک

برای مشاهده کامل مطب کلیک کنید

 

اشتراک‌گذاری

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *