تعریف
عامل با آزمون و خطا در محیط یاد میگیرد؛ اقداماتی که پاداش بیشتر دارند تقویت میشوند.
توضیح کامل
اجزای اصلی: State (حالت محیط)، Action (اقدام عامل)، Reward (پاداش)، Policy (سیاست تصمیم). الگوریتمهای PPO و SAC برای آموزش LLMها رایج هستند. یادگیری تقویتی پایه AlphaGo و سیستمهای کنترل رباتیک پیشرفته است.
مثال کاربردی
عامل بازیباز با بازی میلیونها نسخه شطرنج فقط از نتیجه برد/باخت یاد میگیرد.