Оптимизация: градиентный спуск

Как нейросети учатся — функция потерь, градиентный спуск и его варианты.

Что такое оптимизация в ML

[TODO: Задача минимизации функции потерь, ландшафт потерь]

Градиентный спуск (Gradient Descent)

[TODO: Формула обновления весов, learning rate, размер шага]

Стохастический градиентный спуск (SGD)

[TODO: Мини-батчи, шум в оценке градиента, преимущества SGD]

Adam, AdaGrad и другие оптимизаторы

[TODO: Momentum, адаптивные learning rates, Adam — де-факто стандарт]

Проблемы оптимизации

[TODO: Локальные минимумы, седловые точки, затухающие/взрывающиеся градиенты]

Проверьте себя

[TODO: 2-3 вопроса для самопроверки]

Дополнительные ресурсы

[TODO: Ссылки на материалы для углублённого изучения]