Проблема alignment
[TODO: Почему предобученная модель может давать вредные/ошибочные ответы]
RLHF: пошаговый процесс
[TODO: Сбор данных с human feedback, обучение reward-модели, PPO]
DPO: Direct Preference Optimization
[TODO: Упрощение RLHF без reward-модели, преимущества DPO]
Constitutional AI и RLAIF
[TODO: Self-alignment, автоматический feedback, ответственное развитие]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]