Оценка качества ответов LLM

Метрики и методы оценки LLM — автоматические, человеческие и сравнительные.

Автоматические метрики

[TODO: Perplexity, BLEU, ROUGE, BERTScore — их возможности и ограничения]

Бенчмарки для LLM

[TODO: MMLU, HumanEval, GSM8K, ARC, HellaSwag]

Человеческая оценка

[TODO: Chatbot Arena, ELO-рейтинг, предпочтения людей]

LLM как оценщик

[TODO: LLM-as-a-Judge, GPT-4 для оценки, biases оценщиков]

Проверьте себя

[TODO: 2-3 вопроса для самопроверки]

Дополнительные ресурсы

[TODO: Ссылки на материалы для углублённого изучения]