Strategy/content/rlhf_post.md
+

rlhf_post

review_statusnew
projectfminxyz
creation_date2026-02-25

@fminxyz — Пост: RLHF — как ChatGPT научился слушаться

Серия 3 | Пост 1 из 5 | Дата: 11 марта 2026, 19:30 MSK


Текст поста (~1800 символов)

GPT-3 был умным, но не послушным. GPT-3.5 стал послушным. Разница — три буквы: RLHF 🤖

GPT-3 мог написать инструкцию по взрыву и детский стишок с одинаковым энтузиазмом — оба запроса были “правдоподобными продолжениями”. Язык смоделирован, но не выровнен с тем, что нужно людям.

Решение — Reinforcement Learning from Human Feedback.

3 шага пайплайна:

① SFT (Supervised Fine-Tuning)
Берём GPT-3, обучаем на демонстрациях: “вот вопрос, вот хороший ответ” (разметчики писали вручную). Получаем базовую послушную модель.

② Reward Model
Показываем разметчикам два ответа модели → они выбирают лучший. На этих парах (y_w ≻ y_l) обучаем отдельную нейросеть — reward model RM(y), которая предсказывает “насколько хорош ответ” числом.

③ PPO
Теперь оптимизируем policy (языковую модель) через RL:
max E[RM(y)] − β · KL(π || π_ref)

Первая часть: максимизировать reward (быть полезным).
Вторая часть: не уходить слишком далеко от SFT-модели (KL-penalty).

KL-штраф критичен: без него модель учится “взламывать” reward model — находить ответы с высоким скором, но бессмысленные. β контролирует баланс.

Проблема:
Разметка предпочтений — дорого. Одна итерация RLHF = тысячи человеко-часов. Поэтому ищут альтернативы: DPO (завтра), GRPO (послезавтра).

Результат:
ChatGPT (GPT-3.5-turbo) = GPT-3 + RLHF. Та же архитектура, другой характер. Alignment — не о размере модели, а о том, что мы оптимизируем.

🔜 Завтра: DPO — то же самое, но без reward model и PPO


Метаданные

  • Файлы: rlhf_animation.py → rlhf_animation.mp4 (25с, 104KB)
  • Хэштеги: #нейросети #RLHF #ChatGPT #alignment #deeplearning
  • CTA: “Какой из 2 ответов Claude вам показался умнее?” (опрос с примером)
  • Связь с каналом: PPO = policy gradient оптимизация → как SGD, но в пространстве политик
Choose icon