Зачем квантизировать
[TODO: Проблема памяти GPU, целевое применение — edge devices, consumer hardware]
PTQ vs QAT
[TODO: Post-Training Quantization vs Quantization-Aware Training]
INT8 и INT4 квантизация
[TODO: Гофора, LLM.int8(), NF4, GGUF формат]
Инструменты квантизации
[TODO: llama.cpp, bitsandbytes, GPTQ, AWQ]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]