
Исследователи представили SlideLab — мультиагентную систему для создания научных презентаций по исследовательским работам. Разработка последовательно планирует рассказ, собирает общий набор слайдов, корректирует компоновку и проверяет материалы по исходному документу.
Препринт появился на arXiv 28 сентября 2026 года. Согласно его аннотации, в слепом исследовании с участием людей SlideLab предпочли открытым и коммерческим конкурентам на 77% рассмотренных научных работ. Авторы также заявляют, что системе потребовалось примерно в четыре раза меньше инференс-токенов, чем наиболее сильному открытому решению из проведённого сравнения.
Это результаты самих разработчиков, опубликованные в препринте. До независимого воспроизведения экспериментов их не следует воспринимать как универсальное доказательство превосходства над любыми сервисами генерации презентаций.
Один набор слайдов вместо независимых ответов агентов
SlideLab описан как training-free-фреймворк: для его работы не требуется отдельное дообучение моделей под задачу подготовки презентаций. Это определение не означает, что система обходится без больших языковых или генеративных моделей. Речь идёт об организации их работы без дополнительного обучения специально для SlideLab.
Процесс начинается с планирования повествования. Система должна определить, в каком порядке представить мотивацию, метод, эксперименты и выводы статьи, чтобы аудитория могла следить за логикой доклада. Затем специализированные агенты работают с общим набором слайдов:
- агент планирования формирует структуру презентации;
- агент визуальной генерации подбирает содержание и графические элементы;
- агент компоновки корректирует размещение материалов;
- агент проверки сверяет утверждения, числа и визуальные элементы с исходной работой.
Слайды уточняются итеративно. Такой подход отличается от однократной генерации презентации по длинной инструкции: отдельные компоненты могут исправлять содержательные и визуальные проблемы уже собранного документа.
При этом аннотация не позволяет оценить, насколько надёжно агенты обрабатывают формулы, многочастные таблицы, подписи к экспериментальным графикам и статьи с нестандартной структурой. Эти сценарии особенно существенны для технических докладов, где формально аккуратный слайд может исказить смысл результата.
Что означает показатель 77%
Авторы провели слепое исследование предпочтений: участники оценивали презентации, не зная, какой системой они созданы. В аннотации говорится, что SlideLab оказался предпочтительным по сравнению с открытыми и коммерческими системами на 77% использованных работ.
Формулировку не стоит интерпретировать как «77% пользователей всегда выбрали SlideLab». Заявленный показатель относится к доле научных работ в эксперименте, а его точное значение зависит от дизайна исследования: состава документов, списка конкурентов, инструкций оценщикам и критериев предпочтения.
Аналогичное ограничение относится к четырёхкратной экономии токенов. Сравнение проведено с сильнейшим открытым базовым решением в эксперименте, а не со всеми существующими генераторами презентаций. Токены также не дают полной картины стоимости: на неё влияют выбранные модели, количество вызовов, длина входного текста, обработка изображений и инфраструктура рендеринга.
Для разработчиков показатель всё же представляет практический интерес. Если итеративное редактирование общего документа действительно требует меньше инференса, чем повторная генерация крупных фрагментов, такую архитектуру можно применять в сервисах подготовки докладов, учебных материалов и внутренних технических обзоров.
ConfArena оценивает презентацию с позиции аудитории
Вместе со SlideLab авторы представили ConfArena — систему автоматизированной оценки научных презентаций. Она имитирует просмотр доклада в конференционной аудитории и анализирует презентацию слайд за слайдом, а не как набор изолированных изображений.
По заявлению исследователей, ConfArena воспроизводит полученное от людей ранжирование систем. Для проверки чувствительности разработчики намеренно вносили в презентации несколько типов дефектов:
- подменяли числовые значения;
- ухудшали качество иллюстраций;
- удаляли слайды;
- нарушали их последовательность.
ConfArena обнаруживала эти вмешательства, говорится в аннотации. Это важное различие между оценкой внешнего вида отдельного слайда и проверкой презентации как последовательного рассказа: перестановка двух качественно оформленных страниц может разрушить объяснение, хотя каждая из них по отдельности выглядит корректно.
Однако совпадение общего ранжирования с человеческими оценками ещё не подтверждает, что автоматический оценщик способен заменить профильного рецензента. Аудитория конкретной конференции может учитывать точность терминологии, достаточность доказательств и уместность сокращений — свойства, которые трудно свести к универсальной метрике.
Чего препринт пока не доказывает
Из опубликованной аннотации нельзя заключить, что SlideLab подходит для автономной подготовки готового доклада без проверки автором. Агент верификации снижает риск неподтверждённых утверждений только в той мере, в какой он способен правильно сопоставить элементы слайда с фрагментами исходной статьи.
Не следует автоматически переносить заявленные результаты на другие типы документов. Обзорная статья, экспериментальная работа по машинному обучению и математическое доказательство предъявляют разные требования к структуре презентации. Отдельной проверки требуют графики: система может сохранить правильные числа, но выбрать масштаб, обрезку или подпись, меняющие восприятие результата.
В доступном анонсе также недостаточно данных, чтобы сравнить реальную стоимость запуска, время сборки презентации и качество редактируемого результата. Статус training-free упрощает развёртывание, но не отвечает на вопросы о необходимых моделях, вычислениях и поддерживаемых форматах экспорта.
Что проверить перед практическим использованием
Разработчикам, рассматривающим похожую архитектуру, стоит оценивать три характеристики раздельно: фактическую точность, связность повествования и стоимость полного запуска. Низкий расход токенов не компенсирует пропущенный эксперимент, а визуально цельный набор слайдов не гарантирует корректного пересказа статьи.
Минимальный практический тест можно провести на нескольких документах с заранее известными сложными местами: таблицей основных результатов, графиком с несколькими сериями, формулой и ограничениями метода. После генерации следует проверить происхождение каждого числа, соответствие подписей оригинальным рисункам и сохранение логических переходов между слайдами.
Первичным источником остаётся карточка препринта на arXiv. Полный текст доступен в PDF-версии работы, а библиографические данные можно отдельно сверить через API arXiv. Пока результаты не воспроизведены независимо, SlideLab разумнее рассматривать как исследовательскую архитектуру и предмет для тестирования, а не как подтверждённую замену ручной редактуре научных докладов.








