Общая архитектура Transformer
[TODO: Encoder-decoder структура, входные и выходные данные]
Ключевые компоненты
[TODO: Self-Attention, Feed-Forward, Layer Norm, Residual Connections]
Поток данных в Transformer
[TODO: От токенов к эмбеддингам, через слои внимания, к предсказаниям]
От RNN к Transformer: почему это важно
[TODO: Параллелизм, длинные зависимости, масштабируемость]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]