اصطلاح advanced

یادگیری تقویتی از بازخورد انسانی | RLHF

روشی برای همسوسازی مدل با ارزش‌های انسانی که از رتبه‌بندی انسانی خروجی‌ها برای آموزش مدل پاداش استفاده می‌کند.

RLHF — یادگیری تقویتی از بازخورد انسانی | RLHF

روشی برای همسوسازی مدل با ارزش‌های انسانی که از رتبه‌بندی انسانی خروجی‌ها برای آموزش مدل پاداش استفاده می‌کند.

تعریف

روشی برای همسوسازی مدل با ارزش‌های انسانی که از رتبه‌بندی انسانی خروجی‌ها برای آموزش مدل پاداش استفاده می‌کند.

توضیح کامل

فرآیند سه مرحله دارد: آموزش اولیه supervised، آموزش مدل پاداش از رتبه‌بندی انسانی، و بهینه‌سازی LLM با PPO روی مدل پاداش. ChatGPT اولین محصول مشهور شده با RLHF بود. نسخه‌های بهبودیافته مثل DPO و ORPO سادگی بیشتری دارند.

مثال کاربردی

رتبه‌بندان انسانی از بین چند پاسخ مدل بهترین را انتخاب می‌کنند؛ این سیگنال مدل را کمک‌کننده‌تر می‌کند.

موارد مرتبط

پس‌انتشار | Backpropagation
اصطلاح
کوانتیزیشن | Quantization
اصطلاح
بنچمارک | Benchmark
اصطلاح
پارامتر | Parameter
اصطلاح