Ключевые отличия от классического Transformer
[TODO: Pre-Norm, RMSNorm вместо LayerNorm, GQA вместо MHA]
RoPE (Rotary Position Embedding)
[TODO: Как работает RoPE, преимущества для длинных контекстов]
SwiGLU активация
[TODO: SwiGLU vs ReLU/GELU в Feed-Forward слоях]
Grouped Query Attention (GQA)
[TODO: Эффективное внимание, разделяемые головы, оптимизация KV-кэша]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]