Рекуррентные сети: RNN, LSTM, GRU

Сети с памятью: RNN читает текст шаг за шагом, LSTM и GRU учатся удерживать контекст — и почему трансформеры их вытеснили.

Рекуррентные сети и скрытое состояние

[TODO: Скрытое состояние, развертывание во времени, как RNN читает последовательность шаг за шагом]

Проблема затухающих градиентов

[TODO: Vanishing/exploding gradients, почему RNN забывает начало длинного текста]

LSTM: ворота забывания

[TODO: Ячейка памяти, input/forget/output gates, как LSTM удерживает контекст]

GRU и сравнение архитектур

[TODO: Упрощённая схема GRU, сравнение с LSTM по параметрам и качеству]

Почему трансформеры вытеснили RNN

[TODO: Параллелизм при обучении, длинный контекст, связь с уроками 23–28]

Проверьте себя

[TODO: 2-3 вопроса для самопроверки]

Дополнительные ресурсы

[TODO: Ссылки на материалы для углублённого изучения]