
Исследователи представили бенчмарк PerfReasoning, предназначенный для оценки способности больших языковых моделей (LLM) работать с задачами моделирования производительности аппаратного обеспечения. Результаты показывают существенный разрыв между способностью моделей рассуждать о производительности и их умением генерировать рабочий аналитический код.
Что такое PerfReasoning
Бенчмарк оценивает LLM в двух режимах: как непосредственных «рассуждателей» о производительности и как генераторов кода для аналитических моделей производительности. Моделям предлагаются спецификации вычислительной нагрузки, архитектуры и отображения (mapping). Задачи включают сравнение различных вариантов отображения, а также предсказание объёмов трафика вне чипа и требований к буферу.
PerfReasoning охватывает ключевые аспекты моделирования производительности: анализ повторного использования данных, оценку затрат на перемещение данных и расчёт потребностей в памяти. Такой набор задач приближен к реальным сценариям проектирования аппаратного обеспечения и оптимизации программного обеспечения.
Результаты: рассуждения против кода
Тестирование показало, что сильнейшие закрытые модели (включая GPT-5.6 Sol) превышают 90% точности на вопросах, требующих рассуждений о производительности. Лучшая открытая модель достигает 82,4%. Однако ситуация кардинально меняется при переходе к генерации кода.
Хотя GPT-5.6 Sol демонстрирует pass rate выше 80% на задачах построения моделей, все остальные протестированные конфигурации в среднем показывают менее 15% успешных запусков, причём результаты сильно варьируются от запуска к запуску. Это указывает на принципиальную сложность задачи автоматического построения корректных аналитических моделей производительности.
Методы улучшения: RL помогает, self-revision — нет
Авторы применили два подхода для улучшения результатов. Задача-специфическое обучение с подкреплением (RL) повысило точность рассуждений о выборе отображения для модели размером 4B на 15,7 процентных пункта. В то же время метод многократного самоисправления (self-revision) без внешней обратной связи не показал стабильной эффективности.
Этот результат подтверждает известную закономерность: RL с чёткой наградой (правильный ответ) эффективен для структурированных задач, тогда как итеративное самоисправление без внешнего сигнала часто приводит к ухудшению или зацикливанию.
Практические выводы
PerfReasoning вскрывает фундаментальное ограничение современных LLM: они могут убедительно рассуждать о производительности, но не способны надёжно строить рабочие аналитические модели. Для инженеров и исследователей это означает, что генерация кода для моделирования производительности остаётся задачей, требующей человеческого контроля.
Бенчмарк будет опубликован в открытом доступе, что позволит отслеживать прогресс в этой области. Для разработчиков AI-инструментов для аппаратного дизайна PerfReasoning может стать важным ориентиром при оценке новых моделей.
Источники
Оригинальная публикация: arXiv:2609.04476 — PerfReasoning: How Well Do LLMs Reason on Hardware Performance? (https://arxiv.org/abs/2609.04476)
