Зачем несколько голов внимания
[TODO: Разные подпространства для разных типов отношений между токенами]
Архитектура Multi-Head Attention
[TODO: Разбиение на головы, параллельное вычисление, конкатенация и проекция]
Визуализация голов
[TODO: Что «видит» каждая голова, различные паттерны внимания]
Multi-Head Attention в LLM
[TODO: Количество голов в современных моделях, масштабирование]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]