تعریف
الگوریتم بهینهسازی که با حرکت در جهت مخالف گرادیان تابع هدف، وزنهای مدل را بهبود میدهد.
توضیح کامل
نسخه SGD (تصادفی) از یک نمونه، Mini-batch از چند نمونه در هر گام استفاده میکند. بهینهسازهای پیشرفتهتر مثل Adam ترکیبی از momentum و تطبیق نرخ یادگیری هستند. ریاضیات: $w = w – eta nabla L(w)$ که $eta$ نرخ یادگیری و $L$ تابع خطاست.
مثال کاربردی
تصور کنید چشدامنه کوه هستید و هر قدم را به سمت شیب پایین برمیدارید — گرادیان کاهشی همین است.