Запись архива

Агентный пайплайн DeepLens: маленькая модель обходит LLM-гигантов в диагностике

Пятиэтапный пайплайн с RAG и структурированным выводом позволил 7B-модели показать 60% точности против 23% без workflow — и обойти Sonnet 4.5 и Gemini 3.1 Pro при меньшей стоимости.

Схема пятиэтапного агентного пайплайна DeepLens для медицинской диагностики
Схема пятиэтапного агентного пайплайна DeepLens для медицинской диагностики
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что случилось
На arXiv опубликован препринт arXiv:2607.22555, в котором представлен DeepLens Diagnosis Agent — пятиэтапный пайплайн на основе небольшой медицинской модели JSL Medical Small 7B v2 и RAG. Workflow имитирует клиническое рассуждение: извлечение фактов, консультация с источниками, генерация дифференциального списка, триангуляция доказательств и финальное решение с объяснением.

Почему обсуждают
Без workflow та же модель показывает 23,99% top-1 точности — прибавка +36 п.п. получена исключительно за счёт архитектуры пайплайна, а не увеличения размера модели. При этом агент обходит Claude Sonnet 4.5 и Gemini 3.1 Pro по точности (+9–10 п.п.) и при этом дешевле (0,0072 USD против 0,0110–0,0128 USD за случай).

Ключевые метрики
| Punkt | Detail |
|——-|——–|
| Точность top-1 (с workflow) | 60,14% на DiagnosisArena (915 случаев) |
| Точность top-1 (без workflow) | 23,99% — прирост +36 п.п. |
| Стоимость за случай | 0,0072 USD (24K токенов, A100) |
| Задержка | 24 секунды |
| Сравнение с Sonnet 4.5 | Дешевле на 35–45%, точнее на +9,70 п.п. |
| Сравнение с Gemini 3.1 Pro | Дешевле на 35–45%, точнее на +9,17 п.п. |

Что подтверждено
Результаты получены на бенчмарке DiagnosisArena (915 случаев). Пайплайн генерирует структурированные промежуточные артефакты, что позволяет локализовать ошибки и обеспечивает аудируемость — важное свойство для высоконагруженных медицинских сценариев.

Что ещё неясно
Эксперимент проведён на одном бенчмарке; неизвестно, как workflow обобщается на другие домены (например, радиологию или патологию). Также не раскрыта детальная конфигурация RAG — какие источники, как часто обновляются. Frontier-модели могут быть сильнее в задачах, требующих широкого контекста, а не структурированного вывода.

Источники
Оригинальная статья на arXiv: https://arxiv.org/abs/2607.22555
Верификация через Anthropic (этическая оценка): https://www.anthropic.com/news