RLHF и alignment моделей

Reinforcement Learning from Human Feedback — как делают LLM полезными, безопасными и честными.

Проблема alignment

[TODO: Почему предобученная модель может давать вредные/ошибочные ответы]

RLHF: пошаговый процесс

[TODO: Сбор данных с human feedback, обучение reward-модели, PPO]

DPO: Direct Preference Optimization

[TODO: Упрощение RLHF без reward-модели, преимущества DPO]

Constitutional AI и RLAIF

[TODO: Self-alignment, автоматический feedback, ответственное развитие]

Проверьте себя

[TODO: 2-3 вопроса для самопроверки]

Дополнительные ресурсы

[TODO: Ссылки на материалы для углублённого изучения]