universality_post
@fminxyz Пост 5 — Серия 5: Universality (29 марта 2026)
Возможно, нейросети открывают одни и те же алгоритмы снова и снова — как физические законы
Это звучит как философия. Но это гипотеза с экспериментальным подтверждением.
Вся серия про Mechanistic Interpretability шла к одному открытию:
Пост 1: нейросети строят interpretable circuits внутри
Пост 2: нейроны хранят 300 концептов в 100 нейронах
Пост 3: два конкретных attention head отвечают за in-context learning
Пост 4: SAE разворачивает superposition в 34 миллиона фич
А теперь пост 5 — финальный кусок пазла.
Universality hypothesis (Elhage et al., 2021):
Когда Olah и его команда нашли детекторы кривых в InceptionV1, они решили проверить: а в других сетях то же самое?
Взяли 9 разных архитектур: ResNet, VGG, AlexNet, ViT, ConvNeXt, CLIP…
Результат: те же Gabor-подобные фичи. Те же curve detectors. Те же high-low frequency detectors.
В 8 из 9 архитектур — практически идентичные паттерны на первых слоях.
Что это значит:
Это как если бы разные учёные из разных стран независимо открыли одни и те же математические теоремы.
Нейросети не запоминают данные случайным образом. Они открывают структуру данных. А структура данных в мире — одна.
Поэтому разные архитектуры, обученные на разных данных, сходятся к одним и тем же внутренним алгоритмам.
Временная шкала MI (2020–2025):
2020 → Circuits hypothesis: нейросети = interpretable algorithms
2021 → Universality: те же circuits в 9 архитектурах
2022 → Superposition: полисемантичность как норма
2022 → Induction heads: in-context learning объяснён
2024 → Scaling SAE: 34M фич в Claude 3 Sonnet
2025 → Safety applications: steering vectors, backdoor detection
За 5 лет из “никто ничего не понимает” к первым инструментам безопасности, основанным на понимании.
Зачем это важно практически:
→ Safety: если найти circuits, ответственные за опасное поведение — можно их выключить
→ Efficiency: убрать redundant circuits = меньше вычислений
→ Capability: понять как модель “думает” = улучшить prompt engineering и fine-tuning
Связь с PhD (для тех кто следит 🎓):
Universality + splitting: один и тот же оператор расщепления → одинаковая структура оптимизации → одинаковые circuits?
Это новый угол на Статью 3: может, оптимизатор через splitting буквально формирует interpretable representation?
На этом Series 5 завершена. Roundup — 31 марта.
Что дальше? Series 6 — самое горячее в 2025: Mixture of Experts, Mamba/SSM, или Reasoning models (test-time compute). Голосуйте в комментах.
#MI #interpretability #mechanisticinterpretability #deeplearning #нейросети #fminxyz
Дата публикации: 29 марта 2026, 19:30 MSK
Видео: universality_animation.mp4 (25с, 173KB)
Серия 5: Пост 5/5 ✅ СЕРИЯ ЗАВЕРШЕНА