Квантизация и оптимизация моделей

Снижение точности весов для уменьшения размера и ускорения инференса LLM.

Зачем квантизировать

[TODO: Проблема памяти GPU, целевое применение — edge devices, consumer hardware]

PTQ vs QAT

[TODO: Post-Training Quantization vs Quantization-Aware Training]

INT8 и INT4 квантизация

[TODO: Гофора, LLM.int8(), NF4, GGUF формат]

Инструменты квантизации

[TODO: llama.cpp, bitsandbytes, GPTQ, AWQ]

Проверьте себя

[TODO: 2-3 вопроса для самопроверки]

Дополнительные ресурсы

[TODO: Ссылки на материалы для углублённого изучения]