speculative_decoding_post
Speculative Decoding — @fminxyz Series 14 Post 2
Дата публикации: 24 июня 2026, 19:30 MSK
Файл: speculative_decoding_animation.mp4 (165KB)
Текст поста (Telegram)
LLM inference — принципиально sequential: 1 forward pass → 1 токен. GPU в этот момент использует 2% своей мощности. Как это обойти?
Speculative Decoding (Leviathan et al., 2023):
- Маленькая draft-модель (Llama-68M) предлагает γ=4 токена за 5 мс
- Большая target-модель (Llama-70B) верифицирует все 4 токена за 1 forward pass (50 мс)
- Принимаем токены где
p_target(x)/p_draft(x) ≥ 1, отвергаем где нет
Математика принятия:
α = min(1, p_target(x)/p_draft(x))
E[n] = (1 − α^(γ+1)) / (1 − α)
Если draft хорошо угадывает (α ≈ 0.9), за одну итерацию проходит ~3.5 токена вместо 1. Speedup 2.5–3.1× — при идентичном качестве с target-only.
Гарантия: если draft ошибся — ресэмплируем из target, результат математически совпадает с чистым sampling из большой модели. Без компромисса по качеству.
Вариации: self-speculative decoding (та же модель, пропуск слоёв), Medusa (несколько draft-голов параллельно), Eagle (speculative head обучается отдельно).
\#ml \#llm \#inference \#speculative_decoding \#ai
Серия 9: LLM Efficiency & Inference (12-16 мая 2026)