Агентный пайплайн DeepLens: маленькая модель обходит LLM-гигантов в диагностике

Пятиэтапный пайплайн с RAG и структурированным выводом позволил 7B-модели показать 60% точности против 23% без workflow — и обойти Sonnet 4.5 и Gemini 3.1 Pro при меньшей стоимости.

Редакционная обложка COMRAD404: Агентный пайплайн DeepLens: маленькая модель обходит LLM-гигантов в диагностике
Редакционная обложка COMRAD404: Агентный пайплайн DeepLens: маленькая модель обходит LLM-гигантов в диагностике
Редакционная тематическая обложка COMRAD404

Что случилось
На arXiv опубликован препринт arXiv:2607.22555, в котором представлен DeepLens Diagnosis Agent — пятиэтапный пайплайн на основе небольшой медицинской модели JSL Medical Small 7B v2 и RAG. Workflow имитирует клиническое рассуждение: извлечение фактов, консультация с источниками, генерация дифференциального списка, триангуляция доказательств и финальное решение с объяснением.

Почему обсуждают
Без workflow та же модель показывает 23,99% top-1 точности — прибавка +36 п.п. получена исключительно за счёт архитектуры пайплайна, а не увеличения размера модели. При этом агент обходит Claude Sonnet 4.5 и Gemini 3.1 Pro по точности (+9–10 п.п.) и при этом дешевле (0,0072 USD против 0,0110–0,0128 USD за случай).

Ключевые метрики
| Punkt | Detail |
|——-|———|
| Точность top-1 (с workflow) | 60,14% на DiagnosisArena (915 случаев) |
| Точность top-1 (без workflow) | 23,99% — прирост +36 п.п. |
| Стоимость за случай | 0,0072 USD (24K токенов, A100) |
| Задержка | 24 секунды |
| Сравнение с Sonnet 4.5 | Дешевле на 35–45%, точнее на +9,70 п.п. |
| Сравнение с Gemini 3.1 Pro | Дешевле на 35–45%, точнее на +9,17 п.п. |

Что подтверждено
Результаты получены на бенчмарке DiagnosisArena (915 случаев). Пайплайн генерирует структурированные промежуточные артефакты, что позволяет локализовать ошибки и обеспечивает аудируемость — важное свойство для высоконагруженных медицинских сценариев.

Что ещё неясно
Эксперимент проведён на одном бенчмарке; неизвестно, как workflow обобщается на другие домены (например, радиологию или патологию). Также не раскрыта детальная конфигурация RAG — какие источники, как часто обновляются. Frontier-модели могут быть сильнее в задачах, требующих широкого контекста, а не структурированного вывода.

Источники
Оригинальная статья на arXiv: https://arxiv.org/abs/2607.22555
Верификация через Anthropic (этическая оценка): https://www.anthropic.com/news