Интуиция внимания
[TODO: Почему механизмы вниманияallow модели фокусировать на нужной информации]
Query, Key, Value
[TODO: Роль каждого компонента, матричные умножения, интуиция]
Scaled Dot-Product Attention
[TODO: Формула, деление на sqrt(d_k), softmax]
Masked Self-Attention
[TODO: Маскирование будущих токенов в декодере, causal attention]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]