Strategy/content/loss_landscape_post.md
+

loss_landscape_post

review_statusarchived
projectfminxyz
creation_date2026-02-25

@fminxyz — Loss Landscape современных нейросетей

Текст поста

🏔️ Loss landscape: почему одни минимумы лучше других?

Уважаемые подписчики-геймеры, представьте: вы стоите на вершине горного хребта с завязанными глазами. Вам нужно спуститься в долину. Но долин много — узкие ущелья и широкие плато.

SGD с моментом — это вы с рюкзаком: инерция несёт вас мимо узких ям (sharp minima), но останавливает в широких долинах (flat minima).

Почему это важно?

В 2017 Keskar et al. показали: sharp minima ≈ переобучение, flat minima ≈ генерализация. Модель, застрявшая в узкой яме, идеально помнит тренировочные данные, но ломается на новых.

Современные LLM тренируются с огромными batch size, learning rate warmup, и weight decay — всё это помогает “перепрыгивать” sharp minima и находить flat regions.

На видео: SGD trajectory на реалистичном loss landscape. Видно, как оптимизатор проскакивает мимо острых минимумов и “успокаивается” в широкой долине.

📐 Математика (для ценителей):
Гессиан H в sharp minimum имеет большие собственные значения λ_max → маленькое изменение параметров = большое изменение loss. В flat minimum λ_max мал → robustness.

SAM (Sharpness-Aware Minimization) явно оптимизирует:
min_w max_{‖ε‖≤ρ} L(w + ε)
— ищет параметры, где loss не сильно меняется в ε-окрестности.

🎮 Аналогия: sharp minimum — это стоять на вершине иглы (один шаг в сторону = падение). Flat minimum — стоять на широком плато (можно гулять и ничего не меняется).

Код для генерации видео — в комментариях 👇

#optimization #deeplearning #losslandscape #llm


Ключевые ссылки

  • Keskar et al., “On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima” (ICLR 2017)
  • Foret et al., “Sharpness-Aware Minimization for Efficiently Improving Generalization” (ICLR 2021)
  • Li et al., “Visualizing the Loss Landscape of Neural Nets” (NeurIPS 2018)
Choose icon