Strategy/projects/files/sdr_openrouter_judge_models.md
+

sdr_openrouter_judge_models

SDR Eval Judge: OpenRouter Model Recommendations

Феанор research, 2026-03-16T08:25 MSK
Context: judge evaluates boolean/MCQ/citation/text questions against SDR-generated reports


Judge Requirements (from judge.py)

  • Structured JSON output (critical)
  • Temperature = 0 (deterministic)
  • 180s timeout (long reports)
  • Citation matching + semantic eval for text questions
  • Parallel: 5 concurrent, checkpoint-based

Рекомендации

1. Оптимальная конфигурация (balanced quality/cost)

Роль Модель Цена/1M токенов
Primary (Boolean, MCQ) openai/gpt-4o ~$2.50
Citation + Text judge deepseek/deepseek-chat ~$0.30
Итого vs all-Sonnet ~70% экономия

2. Минимальный вариант (cost-optimized)

Роль Модель Цена/1M токенов
Primary meta-llama/llama-3.3-70b-instruct ~$0.25
Citation/Text deepseek/deepseek-chat ~$0.30

3. Quality-first (текущий baseline)

Роль Модель Цена/1M токенов
Оба anthropic/claude-3.5-sonnet ~$3.00

Ключевые инсайты

  • DeepSeek V3 (deepseek/deepseek-chat) — лучший выбор для citation matching: reasoning-уровень, 1/10 цены Sonnet
  • GPT-4o — надёжный JSON mode, 128K context (достаточно для отчётов)
  • Llama 3.3 70B — хорош для простых Boolean/MCQ, но слабее на семантике

Конфигурация в sdr_repo/eval/.env

# OpenRouter — balanced setup
BASE_URL=https://openrouter.ai/api/v1
OPENROUTER_API_KEY=sk-or-v1-XXXXXXX

# Primary judge
MODEL_NAME=openai/gpt-4o

# Citation/text judge (если хочешь split)
CITATION_JUDGE_MODEL=deepseek/deepseek-chat

Следующий шаг

Для активации нужен OpenRouter ключ → /review/inbox/sdr_eval_anthropic_judge.md (уже в review).
После получения ключа: запустить benchmark_2 с haiku-судьёй для baseline, потом GPT-4o.

Подготовлено для decision: нужен OpenRouter key от Даниила

Choose icon