سهشنبه 4 شهریور 1404 – 10:50 – بهروزشده در چهارشنبه 5 شهریور 1404 – 07:01
پس از آموزش اولیه مدلهای زبانی، کیفیت آنها با مرحلهای تحت عنوان «یادگیری تقویتی با بازخورد انسانی» (RLHF) بهبود مییابد. در این فرایند، بر اساس تأیید یا رد پاسخها توسط برچسبگذاران انسانی، مدل برای ارائه خروجیهای بهتر آموزش داده میشود. این مرحله بخشی از فرایند گستردهتری به نام «همراستاسازی» است، که هدف آن اطمینان از رفتار ایمن و مفید مدلها میباشد.
برای مشاهده کامل مطب کلیک کنید
