Strategy/projects/files/mipt/mipt_lecture26_plan.md
+

mipt_lecture26_plan

МФТИ Лекция 26 — План (2 марта 2026, 13:55-16:55)

Контекст

  • Последняя лекция курса (лекция 26 из 26)
  • Лекция 25 = Gradient Flow (detailed): discretization, convergence, accelerated/stochastic GF, Fokker-Planck
  • Курс покрыл: линалгебра → автодифф → выпуклость → двойственность → LP → градиентные методы → ускорение → Ньютон → проекции → субградиенты → проксимальные → стохастические → AdamW/Muon/Shampoo → нейросетевые insights → large model training → двойственные → continuous-time optimization → gradient flow
  • Формат: 3 часа (2 × 1.5ч с перерывом)
  • next_step проекта: “Организовать проектный процесс”

Предложение: Гибридная лекция

Часть 1 (1.5ч): Современные рубежи оптимизации в ML

Тема: “За пределами SGD: оптимизация на стыке обучения и вывода”

  1. RLHF как задача оптимизации (20 мин)
    - reward model → PPO pipeline → constrained optimization (KL penalty)
    - Связь с двойственностью (лекция 23)

  2. Direct Preference Optimization (DPO) (20 мин)
    - Как превратить RLHF в supervised задачу
    - DPO loss как implicit reward model
    - Связь с Legendre transform (лекция 4!)

  3. Test-Time Compute & Scaling Laws (15 мин)
    - Оптимальное распределение compute: train-time vs test-time
    - Scaling laws как optimization insight

  4. Билevel оптимизация (15 мин)
    - Meta-learning (MAML) как bilevel optimization
    - Hyperparameter optimization (implicit differentiation)
    - Связь с автодиффом (лекция 2) и двойственностью

  5. Open problems & куда двигается поле (10 мин)
    - Muon/Shampoo direction → matrix-aware methods
    - RL for optimization (DeepResearcher, Search-R1)
    - Non-convex landscape understanding

Часть 2 (1.5ч): Проектный процесс

Запуск проектов на весенний семестр:

  1. Формат проектов (20 мин)
    - Вдохновение: STAT-4830
    - OODA-цикл: Observe → Orient → Decide → Act (еженедельно)
    - Обязательный self-critique на каждом этапе

  2. Структура репозитория (10 мин)
    project-repo/ ├── report.md # Эволюционирующий отчёт ├── notebooks/ # Jupyter эксперименты ├── src/ # Модульный код ├── tests/ # Воспроизводимость └── docs/ ├── development_log.md # Лог решений └── llm_exploration/ # AI-ассистированная работа

  3. Оценивание (15 мин)
    - Report (20%) — формулировка, методология, результаты
    - Implementation (35%) — рабочий код, тесты, эксперименты
    - Development process (15%) — decision log, итерации
    - Self-critique (15%) — рефлексия и анализ ошибок
    - Repo organization (15%) — структура и документация

  4. Дедлайны и milestones (15 мин)
    - Каждые 2 недели: report draft + code update + self-critique
    - Неделя 8: lightning talks (mid-semester)
    - Неделя 14-15: финальные презентации
    - Цель: 5 статей, поданных на конференции/журналы/воркшопы

  5. Примеры проектов (15 мин)
    - Из домена курса: ускоренные методы для специфических структур
    - Оптимизация LLM training pipeline
    - Билевельная оптимизация для AutoML
    - Прокс-методы для compressed sensing / sparse recovery
    - Распределённая оптимизация для federated learning

  6. Формирование команд (15 мин)
    - Ассистенты: Тришин, Ребриков, Рубцов, Забара, Хафизов
    - Каждый ассистент курирует 2-3 проекта
    - Студенты pitch-ают идеи или выбирают из предложенных

Подготовка (TODO для Даниила)

  • Подготовить слайды по RLHF/DPO (связать с материалами курса)
  • Создать template репозитория для проектов (fork из damek/STAT-4830)
  • Составить список 10-15 предложенных тем проектов
  • Обсудить с ассистентами распределение проектов
  • Подготовить schedule milestones на весну

Альтернативы

Вариант B: Вся лекция = проекты (если тема 26 не нужна)
Вариант C: Тема “Distributed Optimization” (если проекты могут подождать)
Вариант D: Тема “Zeroth-Order & Derivative-Free Methods” (практически полезно)

Choose icon