Зачем нужна токенизация
[TODO: Почему LLM не работают с сырым текстом, символы vs слова vs токены]
BPE (Byte-Pair Encoding)
[TODO: Алгоритм BPE, как строится словарь, GPT использует BPE]
WordPiece и SentencePiece
[TODO: WordPiece в BERT, Unigram в SentencePiece, unsupervised tokenization]
Специальные токены
[TODO: [CLS], [SEP], [PAD], [UNK], BOS/EOS токены]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]