Механизм внимания (Self-Attention)

Как работает self-attention — Query, Key, Value, softmax и масштабированное произведение.

Интуиция внимания

[TODO: Почему механизмы вниманияallow модели фокусировать на нужной информации]

Query, Key, Value

[TODO: Роль каждого компонента, матричные умножения, интуиция]

Scaled Dot-Product Attention

[TODO: Формула, деление на sqrt(d_k), softmax]

Masked Self-Attention

[TODO: Маскирование будущих токенов в декодере, causal attention]

Проверьте себя

[TODO: 2-3 вопроса для самопроверки]

Дополнительные ресурсы

[TODO: Ссылки на материалы для углублённого изучения]