Автоматические метрики
[TODO: Perplexity, BLEU, ROUGE, BERTScore — их возможности и ограничения]
Бенчмарки для LLM
[TODO: MMLU, HumanEval, GSM8K, ARC, HellaSwag]
Человеческая оценка
[TODO: Chatbot Arena, ELO-рейтинг, предпочтения людей]
LLM как оценщик
[TODO: LLM-as-a-Judge, GPT-4 для оценки, biases оценщиков]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]