
Что случилось
На arXiv опубликован препринт arXiv:2607.22555, в котором представлен DeepLens Diagnosis Agent — пятиэтапный пайплайн на основе небольшой медицинской модели JSL Medical Small 7B v2 и RAG. Workflow имитирует клиническое рассуждение: извлечение фактов, консультация с источниками, генерация дифференциального списка, триангуляция доказательств и финальное решение с объяснением.
Почему обсуждают
Без workflow та же модель показывает 23,99% top-1 точности — прибавка +36 п.п. получена исключительно за счёт архитектуры пайплайна, а не увеличения размера модели. При этом агент обходит Claude Sonnet 4.5 и Gemini 3.1 Pro по точности (+9–10 п.п.) и при этом дешевле (0,0072 USD против 0,0110–0,0128 USD за случай).
Ключевые метрики
| Punkt | Detail |
|——-|——–|
| Точность top-1 (с workflow) | 60,14% на DiagnosisArena (915 случаев) |
| Точность top-1 (без workflow) | 23,99% — прирост +36 п.п. |
| Стоимость за случай | 0,0072 USD (24K токенов, A100) |
| Задержка | 24 секунды |
| Сравнение с Sonnet 4.5 | Дешевле на 35–45%, точнее на +9,70 п.п. |
| Сравнение с Gemini 3.1 Pro | Дешевле на 35–45%, точнее на +9,17 п.п. |
Что подтверждено
Результаты получены на бенчмарке DiagnosisArena (915 случаев). Пайплайн генерирует структурированные промежуточные артефакты, что позволяет локализовать ошибки и обеспечивает аудируемость — важное свойство для высоконагруженных медицинских сценариев.
Что ещё неясно
Эксперимент проведён на одном бенчмарке; неизвестно, как workflow обобщается на другие домены (например, радиологию или патологию). Также не раскрыта детальная конфигурация RAG — какие источники, как часто обновляются. Frontier-модели могут быть сильнее в задачах, требующих широкого контекста, а не структурированного вывода.
Источники
Оригинальная статья на arXiv: https://arxiv.org/abs/2607.22555
Верификация через Anthropic (этическая оценка): https://www.anthropic.com/news