Encoder-only модели
[TODO: BERT,双向 внимание, masked language modeling]
Decoder-only модели
[TODO: GPT, causal attention, авторегрессионная генерация]
Encoder-Decoder модели
[TODO: T5, BART, seq2seq задачи, перевод и суммаризация]
Почему Decoder-only выиграл в LLM
[TODO: Универсальность, простота масштабирования, in-context learning]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]