🤖 Введение
📜 История ИИ
Зарождение ИИ: Тьюринг и первые идеи
Игра в имитацию Тьюринга и Дартмутская конференция 1956 года: как человечество впервые всерьёз задумалось об умных машинах.
Экспертные системы и первые успехи
MYCIN и DENDRAL: попытки 1970–80-х упаковать знания экспертов в правила — и главный урок, который они нам оставили.
Зима ИИ и её преодоление
Почему дважды замерзало финансирование ИИ и какие выводы из тех разочарований помогают трезво смотреть на хайп сегодня.
Революция глубокого обучения
ImageNet и AlexNet: как в 2012 году нейросети на игровых видеокартах внезапно обогнали всех в распознавании изображений.
Трансформеры и эпоха LLM
Attention Is All You Need, GPT и BERT: одна статья 2017 года, из которой выросли современные чат-боты.
🔢 Математические основы
Линейная алгебра: векторы и матрицы
Векторы и матрицы из школьной геометрии — язык нейросетей. Умножаем матрицы руками и понимаем, зачем это моделям.
Теория вероятностей для ИИ
Условная вероятность и формула Байеса — та самая, что встречается в задачах ЕГЭ. Как машины рассуждают о неопределённости.
Статистика и распределения
Среднее, дисперсия и нормальное распределение — на примере оценок и роста одноклассников. Зачем это датасетам.
Оптимизация: градиентный спуск
Производная из 11 класса как компас: градиентный спуск учит нейросеть «спускаться» по склону ошибки к минимуму.
Функции активации
ReLU, sigmoid, softmax — простые функции, благодаря которым сеть умеет описывать сложные нелинейные зависимости.
Функции потерь и метрики
MSE, кросс-энтропия, accuracy и F1: как измеряют ошибку модели и почему одной точности мало.
Регуляризация и борьба с переобучением
Переобучение — зубрёжка по-нейросетевому: dropout, L1/L2 и early stopping, чтобы модель понимала, а не заучивала.
Энтропия и теория информации
Энтропия Шеннона: сколько информации в сообщении. От сжатия файлов до функции потерь языковых моделей.
🧠 Нейросети
Персептрон и полносвязные сети
Один нейрон вручную: взвешенная сумма и порог, затем слои. Прямое распространение сигнала на конкретных числах.
Обратное распространение ошибки
Цепное правило из школьной математики — сердце обучения сетей. Разбираем, куда течёт ошибка и кто исправляет каждый вес.
Свёрточные нейросети (CNN)
Свёртки и пулинг: как сеть учится видеть грани, формы и котиков. Кейс — распознавание рукописных цифр.
Рекуррентные сети: RNN, LSTM, GRU
Сети с памятью: RNN читает текст шаг за шагом, LSTM и GRU учатся удерживать контекст — и почему трансформеры их вытеснили.
Практика: первая нейросеть на Python
Практикум в Google Colab: считаем прямой проход на NumPy, затем обучаем полносвязную сеть на рукописных цифрах средствами Keras.
Автоэнкодеры и генеративные модели
Сжать и восстановить: автоэнкодеры и VAE — как машина учится представлять данные и придумывать новые образы.
GAN и диффузионные модели
GAN как дуэль фальшивомонетчика и сыщика; диффузия Stable Diffusion: как картинка собирается из шума по запросу.
⚡ Архитектура Transformer
Архитектура Transformer: обзор
Большая карта трансформера: энкодер, декодер, внимание. Почему эта схема вытеснила RNN в работе с текстом.
Механизм внимания (Self-Attention)
Query, Key, Value на библиотечной аналогии: считаем self-attention руками на коротком предложении.
Multi-Head Attention
Зачем вниманию много голов: параллельные «взгляды» на предложение и сборка общего вывода.
Позиционное кодирование (Positional Encoding)
Порядок слов меняет смысл: синусоиды и RoPE — как трансформер отличает «кот съел мышь» от «мышь съела кота».
Encoder и Decoder
BERT понимает, GPT порождает: чем encoder-only отличается от decoder-only и какая модель для какой задачи.
Нормализация и остаточные связи
Два тихих героя глубоких сетей: LayerNorm и обходные пути, без которых обучение глубоких моделей разваливается.
📊 Обучение моделей
Сбор и подготовка данных
Мусор на входе — мусор на выходе: собираем свой мини-датасет и готовим его к обучению руками и pandas.
Процесс обучения: батчи, эпохи, learning rate
Что происходит при обучении: эпохи, батчи, learning rate и warmup — как настроить тренировку и не «пересолить».
Transfer Learning и Fine-tuning
Знание переносимо: стратегии переноса предобученной модели на новую задачу — от заморозки слоёв до полной тонкой настройки.
Практика: дообучаем модель на своих данных
Практикум в Colab: берём предобученную сеть, замораживаем основу и дообучаем финальные слои на своём мини-датасете.
RLHF и alignment моделей
Как ChatGPT научили быть полезным: RLHF на оценках людей. Обсуждаем предвзятость моделей и безопасность.
💬 Большие языковые модели
Что такое LLM: от GPT до современных моделей
Карта больших языковых моделей: GPT, Claude, Gemini, Llama, GigaChat, YandexGPT — сходства, различия, применение.
Токенизация и словарь
Почему модели ломаются на редких словах: BPE-токены — как текст превращается в числа, которые «ест» сеть.
Prompt Engineering
Роль, контекст, формат ответа, chain-of-thought: практикум — формулируем запросы и сравниваем результаты на GigaChat и Алисе.
In-context Learning: Zero-shot и Few-shot
Показываем модели несколько примеров прямо в промпте — практикум: zero-shot против few-shot на реальных задачах без переобучения.
RAG: ответы по вашим документам
Практикум: собираем мини-RAG по своим конспектам — эмбеддинги, векторный поиск и генерация на Python, знакомство с векторными базами.
Оценка качества ответов LLM
Бенчмарки, perplexity и живая оценка: как честно сравнивать модели и почему таблицам лидеров верить нельзя.
Квантизация: большая модель на слабом железе
INT8, INT4, GGUF: как уместить огромную модель в ноутбук, сколько точности теряется и зачем это нужно.
🦙 Открытые модели и локальный запуск
Семейство моделей Llama
Открытые веса меняют индустрию: Llama, Qwen, Mistral — сравниваем поколения и учимся выбирать размер модели под задачу и железо.
Архитектура Llama
RoPE, GQA, SwiGLU: что инженеры улучшают в современных открытых трансформерах — разбор эволюции архитектуры на примере Llama и Qwen.
Запуск Llama локально
Практикум: личная модель без интернета — Ollama и LM Studio. Скачиваем GGUF-модель и проверяем, какую Llama потянет ваш компьютер.
Дообучение Llama на своих данных
Практикум: LoRA и QLoRA — дообучаем открытую модель на своих примерах без суперкомпьютера: небольшой датасет и ноутбук.
Llama через API и интеграция
Практикум: Groq, Together AI, OpenRouter — подключаем открытые модели к своим проектам через API и пишем первый интеграционный скрипт.
🛠️ Инструменты разработчика
Обзор ИИ-инструментов для разработчиков
Автодополнение, чат-ассистенты, автономные агенты: карта ИИ-инструментов разработчика и критерии выбора.
Cline: AI-ассистент для VS Code
Агент прямо в редакторе: даём Cline задачу, разбираем его план, правки файлов и работу с MCP.
Opencode: интерактивная CLI-разработка
ИИ-агент в терминале: как Opencode исследует проект, предлагает изменения и держит диалог по делу.
Hermes Agent: автономные ИИ-агенты
ReAct и tool use: как устроены агенты, которые сами планируют шаги и действуют. Разбираем агента по косточкам.
Интеграция инструментов в рабочий процесс
Финальный проект: выбор инструментов под задачу и учебный проект с ИИ-агентом. Этика, безопасность, академическая честность.