Токенизация и словарь

Как текст разбивается на токены — BPE, WordPiece, SentencePiece и влияние на работу LLM.

Зачем нужна токенизация

[TODO: Почему LLM не работают с сырым текстом, символы vs слова vs токены]

BPE (Byte-Pair Encoding)

[TODO: Алгоритм BPE, как строится словарь, GPT использует BPE]

WordPiece и SentencePiece

[TODO: WordPiece в BERT, Unigram в SentencePiece, unsupervised tokenization]

Специальные токены

[TODO: [CLS], [SEP], [PAD], [UNK], BOS/EOS токены]

Проверьте себя

[TODO: 2-3 вопроса для самопроверки]

Дополнительные ресурсы

[TODO: Ссылки на материалы для углублённого изучения]