Что такое оптимизация в ML
[TODO: Задача минимизации функции потерь, ландшафт потерь]
Градиентный спуск (Gradient Descent)
[TODO: Формула обновления весов, learning rate, размер шага]
Стохастический градиентный спуск (SGD)
[TODO: Мини-батчи, шум в оценке градиента, преимущества SGD]
Adam, AdaGrad и другие оптимизаторы
[TODO: Momentum, адаптивные learning rates, Adam — де-факто стандарт]
Проблемы оптимизации
[TODO: Локальные минимумы, седловые точки, затухающие/взрывающиеся градиенты]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]