Запись архива

AI-агенты против инференса: новый бенчмарк InferenceBench показал предел «заученных» решений

Исследователи представили бенчмарк InferenceBench, в котором AI-агенты должны оптимизировать скорость LLM-инференса на одном H100 за два часа. Результаты показали, что агенты превосходят наивный baseline, но уступают простому перебору гиперпараметров — узкое место не в знаниях, а в способности перебирать конфигурации.

Схема бенчмарка InferenceBench: агент, LLM, сервер, H100, два часа
Схема бенчмарка InferenceBench: агент, LLM, сервер, H100, два часа
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Суть

На arxiv появилась работа InferenceBench — бенчмарк для оценки способности AI-агентов выполнять открытую инженерную задачу: развернуть OpenAI-совместимый сервер инференса и оптимизировать скорость обработки LLM. Агенту дают целевую модель, один H100, сценарий оптимизации и бюджет в два часа реального времени. Четыре сценария изолируют узкие места: prefill latency, decode latency, пропускную способность concurrent-запросов и сбалансированный вариант.

Почему обсуждают

Проблема актуальна: AI-агентов всё чаще используют для автоматизации R&D, но существующие бенчмарки часто позволяют решить задачу «по памяти» — подобрать известные параметры. InferenceBench устроен так, что заученные решения дают лишь ограниченный прирост. Агенты вынуждены реально экспериментировать с конфигурациями, что приближает оценку к настоящей инженерной работе.

Что подтверждено

Punkt Detail
Платформа arXiv cs.AI
Название InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents
Дата публикации 24 июля 2026
Конфигурация агентов 15 frontier-агентов, один H100, 2 часа, 4 сценария
Лучший результат до 8.08× быстрее наивного PyTorch, до 4.05× — vLLM с настройками по умолчанию
Ограничение простой перебор гиперпараметров даёт до 11.53× — агенты не дотягивают
Основная причина агенты сходятся на одном фреймворке, тестируют мало конфигураций, тратят время на ремонт и перезамеры

Что остаётся неясным

Авторы отмечают, что узкое место — не знание техник оптимизации, а способность агента генерировать разнообразные конфигурации, систематически их оценивать и фиксировать лучшее решение. Вопрос: можно ли это исправить дообучением, лучшими инструментами или изменением архитектуры агента? Пока неясно, как масштабируется такой подход на другие сценарии (не только инференс).

Что дальше

Стоит следить за реакцией сообщества: возможно, авторы опубликуют код бенчмарка и данные траекторий агентов. Также полезно сравнить результаты с другими работами по автоматизации ML-инженерии (MLAgentBench, SWE-bench).

Источник: arXiv:2607.20468, https://arxiv.org/abs/2607.20468. Verification lead: https://openai.com/news/ .