sdr_status_apr2026
SDR Project Status — April 2026
Written: 2026-04-11 01:15 MSK (Feanor worker, auto-level)
Current State
SDR (Scientific Deep Research) — AI4Science Сбера, архитектурно готов, заблокирован на eval.
What’s Working ✅
- Codebase: 106/106 тестов (venv python3.13). Все unit/integration тесты GREEN.
- Eval framework:
sdr_repo/eval/— полноценный LLM judge (config.py, judge.py, models.py, eval_runner.py). Антропик-based оценщик с 6 критериями (clarity/depth/balance/breadth/support/insightfulness). - DRACO benchmark: лучший результат —
claude-opus50.3/100.llama-3.1-8b= 8.7/100 (сырой baseline без API ключей). Опубликовано на dev.ai4s.pro (deployed by Danil, 30 мар). - Deployment: dev.ai4s.pro запущен, DataChat + Neuler рядом. Albert ведёт pipeline-менеджмент.
- Architecture audit: завершён 2026-03-09 (sdr_code_audit_2026_03_09.md).
Blockers ❌
-
ANTHROPIC_API_KEY — нет доступа к Claude-haiku для eval judge. Без ключа SDR stuck на llama-3.1-8b (8.7/30). С claude-haiku потенциал ≥30-40/100 качественный скачок.
- Решение: Даниил передаёт API ключ (через Todoist task или прямо в sdr_repo/eval/.env) -
OPENROUTER_API_KEY — для Qwen 3.6 Plus (free tier) как альтернативного judge model.
- Решение: зарегистрироваться на openrouter.ai → добавить ключ в /root/sdr_repo/eval/.env -
Eval branch commit — готов, ждёт ОК Даниила.
- Review item:/root/data/review/inbox/sdr_eval_anthropic_judge.md
- При ОК:git add eval/config.py eval/judge.py eval/.env eval/tests/test_judge_config.py && git commit
Benchmark History
| Date | Model | Score |
|---|---|---|
| 2026-03-08 | llama-3.1-8b | 9.4/100 |
| 2026-03-08 | claude-haiku (3 queries) | ~40/100 (estimate) |
| 2026-04-01 | claude-opus (DRACO) | 50.3/100 |
Next Steps (приоритет)
- [ask] Получить ANTHROPIC_API_KEY от Даниила → запустить eval на 30+ queries → получить реальный DRACO score
- [ask] Одобрить eval branch commit →
sdr_eval_anthropic_judge.md - [auto] После API ключа: полный eval прогон → обновить DRACO baseline на dev.ai4s.pro
- [auto] Интегрировать OpenRouter (Qwen free) как fallback judge для сравнения
Team
- Даниил: архитектурный контроль, API ключи, одобрение commits
- Albert: pipeline-менеджмент, dev.ai4s.pro deployment
- DRACO bench опубликован, активного code dev нет до разблокировки API ключей
Следующий апдейт этого файла: после получения API ключей