
Суть
На arxiv появилась работа InferenceBench — бенчмарк для оценки способности AI-агентов выполнять открытую инженерную задачу: развернуть OpenAI-совместимый сервер инференса и оптимизировать скорость обработки LLM. Агенту дают целевую модель, один H100, сценарий оптимизации и бюджет в два часа реального времени. Четыре сценария изолируют узкие места: prefill latency, decode latency, пропускную способность concurrent-запросов и сбалансированный вариант.
Почему обсуждают
Проблема актуальна: AI-агентов всё чаще используют для автоматизации R&D, но существующие бенчмарки часто позволяют решить задачу «по памяти» — подобрать известные параметры. InferenceBench устроен так, что заученные решения дают лишь ограниченный прирост. Агенты вынуждены реально экспериментировать с конфигурациями, что приближает оценку к настоящей инженерной работе.
Что подтверждено
| Punkt | Detail |
|---|---|
| Платформа | arXiv cs.AI |
| Название | InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents |
| Дата публикации | 24 июля 2026 |
| Конфигурация агентов | 15 frontier-агентов, один H100, 2 часа, 4 сценария |
| Лучший результат | до 8.08× быстрее наивного PyTorch, до 4.05× — vLLM с настройками по умолчанию |
| Ограничение | простой перебор гиперпараметров даёт до 11.53× — агенты не дотягивают |
| Основная причина | агенты сходятся на одном фреймворке, тестируют мало конфигураций, тратят время на ремонт и перезамеры |
Что остаётся неясным
Авторы отмечают, что узкое место — не знание техник оптимизации, а способность агента генерировать разнообразные конфигурации, систематически их оценивать и фиксировать лучшее решение. Вопрос: можно ли это исправить дообучением, лучшими инструментами или изменением архитектуры агента? Пока неясно, как масштабируется такой подход на другие сценарии (не только инференс).
Что дальше
Стоит следить за реакцией сообщества: возможно, авторы опубликуют код бенчмарка и данные траекторий агентов. Также полезно сравнить результаты с другими работами по автоматизации ML-инженерии (MLAgentBench, SWE-bench).
Источник: arXiv:2607.20468, https://arxiv.org/abs/2607.20468. Verification lead: https://openai.com/news/ .