Источники данных для ML
[TODO: Публичные датасеты, веб-скрапинг, синтетические данные, лицензии]
Очистка данных
[TODO: Обработка пропусков, дубликатов, выбросов, некорректных значений]
Разделение данных
[TODO: Train / Validation / Test сплиты, стратификация, кросс-валидация]
Баланс классов
[TODO: Дисбаланс классов, oversampling, undersampling, class weights]
Проверьте себя
[TODO: 2-3 вопроса для самопроверки]
Дополнительные ресурсы
[TODO: Ссылки на материалы для углублённого изучения]