Strategy/content/speculative_decoding_post.md
+

speculative_decoding_post

review_statusnew
projectfminxyz
creation_date2026-03-06

Speculative Decoding — @fminxyz Series 14 Post 2

Дата публикации: 24 июня 2026, 19:30 MSK
Файл: speculative_decoding_animation.mp4 (165KB)


Текст поста (Telegram)

LLM inference — принципиально sequential: 1 forward pass → 1 токен. GPU в этот момент использует 2% своей мощности. Как это обойти?

Speculative Decoding (Leviathan et al., 2023):

  1. Маленькая draft-модель (Llama-68M) предлагает γ=4 токена за 5 мс
  2. Большая target-модель (Llama-70B) верифицирует все 4 токена за 1 forward pass (50 мс)
  3. Принимаем токены где p_target(x)/p_draft(x) ≥ 1, отвергаем где нет

Математика принятия:

α = min(1, p_target(x)/p_draft(x))
E[n] = (1  α^(γ+1)) / (1  α)

Если draft хорошо угадывает (α ≈ 0.9), за одну итерацию проходит ~3.5 токена вместо 1. Speedup 2.5–3.1× — при идентичном качестве с target-only.

Гарантия: если draft ошибся — ресэмплируем из target, результат математически совпадает с чистым sampling из большой модели. Без компромисса по качеству.

Вариации: self-speculative decoding (та же модель, пропуск слоёв), Medusa (несколько draft-голов параллельно), Eagle (speculative head обучается отдельно).

\#ml \#llm \#inference \#speculative_decoding \#ai


Серия 9: LLM Efficiency & Inference (12-16 мая 2026)

Choose icon