rlhf_overview_post
@fminxyz — Пост: 4 способа выровнять LLM — итог серии
Серия 3 | Пост 5 из 5 | Дата: 15 марта 2026, 19:30 MSK
Текст поста (~1800 символов)
Серия про alignment. 4 метода за 4 дня. Итог 🧵
За неделю мы разобрали, как из языковой модели делают “правильное” AI:
RLHF (2022) — пионер. Три шага: SFT → Reward Model → PPO.
Люди размечают предпочтения → нейросеть учится предсказывать “хорошесть” → policy оптимизирует её через RL.
Мощно, но дорого: нужны тысячи человеко-часов разметки.
→ ChatGPT (GPT-3.5) = GPT-3 + RLHF.
DPO (2023, Stanford) — элегантное упрощение. Один вывод Rafailov et al.:
оптимальная policy уже кодирует reward неявно. Reward model не нужна.
Один лосс, одна модель, то же качество.
→ Все современные Llama/Mistral instruction-tuned = DPO.
GRPO (2024, DeepSeek) — убирает даже человеческие предпочтения.
Для задач с верификатором (математика, код): сэмплируй группу из G ответов, считай advantage внутри группы.
Critic не нужен — baseline = среднее по группе.
→ DeepSeek R1 обучился рассуждать, не видя готовых объяснений.
CAI (2022, Anthropic) — alignment через конституцию.
Та же модель генерирует черновик → сама его критикует → переписывает.
Разметчики не видят вредного контента. Human labels → нуль.
→ Claude 1/2/3 — все обучены с CAI.
Тренд виден:
2022: нужны тысячи людей и 3 нейросети
2024: нужны задача + верификатор
Следующий рубеж — автоматическое построение верификатора. LLM, которая сама учит себя быть лучше.
Серия завершена. Следующая: Score-based diffusion models (DDPM → DDIM → Flow Matching → CFG).
Если был полезен этот цикл — поделись с тем, кто спрашивает “как устроен ChatGPT” 🙏
Метаданные
- Файлы: rlhf_overview_animation.py → rlhf_overview_animation.mp4 (25с, 2MB)
- Хэштеги: #нейросети #RLHF #DPO #GRPO #CAI #alignment #deeplearning
- CTA: “Какой метод кажется самым элегантным?”
- Визуал: radar chart — 5 осей (автономность/стабильность/compute/универсальность/качество), 4 метода появляются по очереди → всё вместе в конце
- Связь с серией: финальный пост, объединяет все 4 поста серии