تعریف
روشی برای همسوسازی مدل با ارزشهای انسانی که از رتبهبندی انسانی خروجیها برای آموزش مدل پاداش استفاده میکند.
توضیح کامل
فرآیند سه مرحله دارد: آموزش اولیه supervised، آموزش مدل پاداش از رتبهبندی انسانی، و بهینهسازی LLM با PPO روی مدل پاداش. ChatGPT اولین محصول مشهور شده با RLHF بود. نسخههای بهبودیافته مثل DPO و ORPO سادگی بیشتری دارند.
مثال کاربردی
رتبهبندان انسانی از بین چند پاسخ مدل بهترین را انتخاب میکنند؛ این سیگنال مدل را کمککنندهتر میکند.