mipt_project_topics_guide
Выбери тему проекта — МФТИ Методы оптимизации 2026
Для студентов: D1 дедлайн 14 марта 2026. Сессия 9 марта.
Выбери тему до 09 марта — обсудим на сессии.
Критерии хорошей темы
✅ Есть чёткая задача оптимизации (min f(x))
✅ Baseline воспроизводим за 1 неделю
✅ Потенциал для публикации (новизна или сравнение)
✅ Ты можешь объяснить постановку за 2 минуты
❌ “Обучим нейросеть” — нет формулировки задачи
❌ “Реализуем SOTA 2024” — нереалистично за неделю
Топ-10 тем (с готовой формулировкой)
1. 🔪 Operator Splitting для обучения нейросетей
Постановка: $\min_W \mathcal{L}(W) + \frac{\lambda}{2}\|W\|^2$ через Ли-Троттера и Стренга
Baseline: SGD+weight_decay vs split-SGD на MNIST/CIFAR-10
Зачем интересно: Прямая связь с темами курса + разрабатывается в Сколтехе
Сложность: ★★★☆ | Потенциал публикации: Высокий
Ссылки: Alecsa et al. 2020, McLachlan & Quispel 2002
2. ⚡ Muon vs Adam vs Shampoo — битва оптимизаторов 2025
Постановка: $\min_\theta \mathcal{L}(\theta)$ с разными адаптивными методами
Baseline: AdamW на GPT-2 small (≤ 1 час на A100)
Зачем интересно: Muon (2024) обгоняет Adam на языковых задачах, но почему?
Сложность: ★★★☆ | Потенциал публикации: Средний
Ссылки: Jordan et al. “Muon” (2024), Vyas et al. “SOAP” (2024)
3. 🔥 Гроккинг как фазовый переход
Постановка: Обучить $f_\theta$ на $a \circ b \pmod{p}$ — почему сначала переобучение, потом резкая генерализация?
Baseline: Трансформер 1L на сложении mod p (воспроизводится за 2 часа)
Зачем интересно: Фазовые переходы в ландшафте потерь — для физиков!
Сложность: ★★★★ | Потенциал публикации: Высокий
Ссылки: Power et al. “Grokking” (2022), Nanda et al. “Progress measures” (2023)
4. 🌊 Симплектические интеграторы для ускоренной оптимизации
Постановка: Нестеров как дискретизация $H(x, p) = f(x) + \frac{1}{2}\|p\|^2$ (Störmer-Verlet)
Baseline: GD vs Nesterov vs симплектические методы на квадратичных задачах
Зачем интересно: Мост между физикой и оптимизацией — для физфаковцев!
Сложность: ★★★☆ | Потенциал публикации: Средний
Ссылки: Su et al. “ODE Nesterov” (2016), Wilson et al. “Lyapunov” (2021)
5. 🚀 Flow Matching и Optimal Transport
Постановка: $\min_v \int_0^1 \mathbb{E}[\|v_t(x) - u_t(x)\|^2] dt$, сравнить OT-планы
Baseline: CFM на 2D → MNIST, FID как метрика
Зачем интересно: Flow matching заменяет диффузию — красивые анимации траекторий!
Сложность: ★★★★ | Потенциал публикации: Средний
Ссылки: Lipman et al. “Flow Matching” (2023), Tong et al. “CFM” (2024)
6. 🗜️ Квантование LLM: оптимизация на дискретных множествах
Постановка: $\min_{\hat{W}} \|WX - \hat{W}X\|_F^2$ при $\hat{W} \in \mathcal{Q}_{4\text{bit}}$
Baseline: GPTQ vs RTN на Llama-3-1B (perplexity на WikiText-2)
Зачем интересно: Запустить LLM на телефоне — конкретный практический результат
Сложность: ★★☆☆ | Потенциал публикации: Низкий
Ссылки: Frantar et al. “GPTQ” (2023), Lin et al. “AWQ” (2024)
7. 🎯 Bilevel оптимизация: MAML и метаобучение
Постановка: $\min_\lambda \mathcal{L}_{val}(\theta^*(\lambda))$ при $\theta^* = \arg\min_\theta \mathcal{L}_{train}(\theta, \lambda)$
Baseline: First-order MAML на few-shot (Omniglot/mini-ImageNet)
Зачем интересно: Гиперпараметры как переменная оптимизации!
Сложность: ★★★★ | Потенциал публикации: Средний
Ссылки: Finn et al. “MAML” (2017), Lorraine et al. “Millions of Hyperparameters” (2020)
8. 📡 Federated Learning: оптимизация при нехватке коммуникаций
Постановка: $\min_x \sum_i F_i(x)$ с ограничениями на количество раундов связи
Baseline: FedAvg на CIFAR-10 IID vs non-IID, метрика: rounds to convergence
Зачем интересно: Реальный сценарий: обучение без передачи данных
Сложность: ★★★☆ | Потенциал публикации: Средний
Ссылки: McMahan et al. “FedAvg” (2017), Li et al. “FedProx” (2020)
9. 🧬 Scaling Laws: эмпирическая теория масштабирования
Постановка: $L(N,D) = aN^{-\alpha} + bD^{-\beta} + c$ — подогнать из экспериментов
Baseline: 10-20 моделей (1M–100M params), нелинейная регрессия
Зачем интересно: Предсказать качество GPT-5 по кривой обучения GPT-mini
Сложность: ★★★☆ | Потенциал публикации: Средний
Ссылки: Kaplan et al. (2020), Hoffmann et al. “Chinchilla” (2022)
10. 🤖 LLM Fine-tuning: LoRA vs Full через призму оптимизации
Постановка: $\min_{\theta_0+BA} \mathcal{L}(\theta)$, ранг $r \ll d$ — почему работает?
Baseline: Full fine-tune vs LoRA rank 8/16/32 на Llama-3-1B + выбранный датасет
Зачем интересно: Теоретически: LoRA = оптимизация на многообразии низкого ранга
Сложность: ★★☆☆ | Потенциал публикации: Низкий (много конкурентов)
Ссылки: Hu et al. “LoRA” (2022), Zhao et al. “GaLore” (2024)
Как выбрать
| Цель | Рекомендация |
|---|---|
| Публикация | Темы 1, 2, 3, 5, 7 |
| Для физиков | Темы 4, 3 (фазовые переходы!) |
| Быстрый baseline | Темы 6, 10 |
| Связь с курсом | Темы 1, 4, 8 |
| Самая актуальная 2025 | Тема 2 (Muon/SOAP) |
Чек-лист перед сессией 9 марта
- Выбрать тему (одну!)
- Сформулировать задачу оптимизации: что именно минимизируем, какое множество $x$
- Найти baseline статью/репозиторий (GitHub ссылка)
- Оценить: смогу воспроизвести за 7 дней (D2 = 28 марта)?
- Собрать команду 2-4 человека
Создано Феанором, 2026-03-03 20:10 MSK
Для сессии 09.03.2026, дедлайн D1: 14.03.2026