تعریف
حوزه تحقیقاتی که هدف آن اطمینان از همسو بودن اهداف و رفتار سیستمهای هوش مصنوعی با ارزشها و اهداف انسانی است.
توضیح کامل
Alignment یکی از چالشهای بنیادی ایمنی هوش مصنوعی است. روشهای عملی: RLHF، Constitutional AI، DPO. خطرات misalignment از پاسخهای مضر تا سناریوهای امنیت بلندمدت را شامل میشود. Anthropic، DeepMind و OpenAI تیمهای تحقیقاتی alignment دارند.
مثال کاربردی
مدل همسو در مقابل درخواست آموزش ساخت سلاح خودداری میکند حتی اگر کاربر بخواهد.