
На arxiv опубликован препринт, описывающий Paper Pilot — экспертную систему с обязательным участием человека (human-in-the-loop) для генерации научных рукописей в прикладных науках. Система решает проблему распространения непроверенных утверждений и фабрикации данных в AI-ассистированных научных рабочих процессах.
Как устроен Paper Pilot
Система адаптирует методологию Collaborative Agent Reasoning Engineering (CARE) к процессу создания рукописей. Ключевое нововведение — восемь обязательных «шлюзов утверждения» (approval gates) на пути от идеи до финального утверждения. Каждый шлюз требует явного одобрения человека-автора; система имеет право отказать в переходе на следующий этап (no-pass criteria).
Paper Pilot вводит строгое разделение утверждений на два типа:
– Утверждения, подкрепленные литературой (literature-grounded)
– Утверждения, подкрепленные экспериментальными данными (artifact-grounded)
Все числовые данные и интерпретации должны оставаться отслеживаемыми до утвержденных источников. Система ведет полный аудит (audit logging) и использует блокировку версий с привязкой к доказательствам (evidence-locked revision control).
Результаты тестирования
В контролируемом эксперименте с механической оценкой (две коммерческие LLM, реальные статьи из arXiv, без LLM-судьи) сравнивали стандартных «драфтеров» и ту же модель под управлением Paper Pilot. Результаты:
– Обычные драфтеры фабриковали до 25% цитирований и никогда не отмечали пробелы в доказательствах
– Paper Pilot под evidence-locked правилами не сгенерировал ни одного фиктивного цитирования и явно помечал все искусственно внесенные пробелы как плейсхолдеры
Предварительные результаты по привязке результатов, ревизии и устойчивости к атакам указывают в том же направлении. Полная оценка запланирована на будущие работы.
Практическое значение
Система позиционирует LLM-ассистированное написание как контролируемый процесс поддержки принятия решений человеком, а не полностью автономный конвейер. Промпт системы опубликован в открытом доступе и может быть развернут в ChatGPT, Gemini, Claude или институциональных LLM-средах.
Ограничения
Метод требует явного участия человека на каждом этапе, что замедляет процесс. Полная валидация на реальных научных рабочих процессах еще не проведена. Тестирование проводилось на ограниченном наборе сценариев.
Источники
– Препринт на arXiv: https://arxiv.org/abs/2608.28596
– Anthropic — верификация подхода: https://www.anthropic.com/news
