Сбор и подготовка данных

Откуда берутся данные для обучения, их очистка, нормализация и разделение на train/val/test.

Источники данных для ML

[TODO: Публичные датасеты, веб-скрапинг, синтетические данные, лицензии]

Очистка данных

[TODO: Обработка пропусков, дубликатов, выбросов, некорректных значений]

Разделение данных

[TODO: Train / Validation / Test сплиты, стратификация, кросс-валидация]

Баланс классов

[TODO: Дисбаланс классов, oversampling, undersampling, class weights]

Проверьте себя

[TODO: 2-3 вопроса для самопроверки]

Дополнительные ресурсы

[TODO: Ссылки на материалы для углублённого изучения]