Запись архива

LLM не умеют строить модели производительности: бенчмарк PerfReasoning вскрывает разрыв между рассуждениями и кодом

Новый бенчмарк PerfReasoning оценивает способность LLM рассуждать о производительности аппаратного обеспечения. Закрытые модели проходят тест с результатом выше 90%, но написание аналитического кода для моделей производительности даётся им значительно хуже — средний показатель успеха ниже 15%.

Схема бенчмарка PerfReasoning для оценки LLM в задачах анализа производительности аппаратного обеспечения
Схема бенчмарка PerfReasoning для оценки LLM в задачах анализа производительности аппаратного обеспечения
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

Исследователи представили бенчмарк PerfReasoning, предназначенный для оценки способности больших языковых моделей (LLM) работать с задачами моделирования производительности аппаратного обеспечения. Результаты показывают существенный разрыв между способностью моделей рассуждать о производительности и их умением генерировать рабочий аналитический код.

Что такое PerfReasoning

Бенчмарк оценивает LLM в двух режимах: как непосредственных «рассуждателей» о производительности и как генераторов кода для аналитических моделей производительности. Моделям предлагаются спецификации вычислительной нагрузки, архитектуры и отображения (mapping). Задачи включают сравнение различных вариантов отображения, а также предсказание объёмов трафика вне чипа и требований к буферу.

PerfReasoning охватывает ключевые аспекты моделирования производительности: анализ повторного использования данных, оценку затрат на перемещение данных и расчёт потребностей в памяти. Такой набор задач приближен к реальным сценариям проектирования аппаратного обеспечения и оптимизации программного обеспечения.

Результаты: рассуждения против кода

Тестирование показало, что сильнейшие закрытые модели (включая GPT-5.6 Sol) превышают 90% точности на вопросах, требующих рассуждений о производительности. Лучшая открытая модель достигает 82,4%. Однако ситуация кардинально меняется при переходе к генерации кода.

Хотя GPT-5.6 Sol демонстрирует pass rate выше 80% на задачах построения моделей, все остальные протестированные конфигурации в среднем показывают менее 15% успешных запусков, причём результаты сильно варьируются от запуска к запуску. Это указывает на принципиальную сложность задачи автоматического построения корректных аналитических моделей производительности.

Методы улучшения: RL помогает, self-revision — нет

Авторы применили два подхода для улучшения результатов. Задача-специфическое обучение с подкреплением (RL) повысило точность рассуждений о выборе отображения для модели размером 4B на 15,7 процентных пункта. В то же время метод многократного самоисправления (self-revision) без внешней обратной связи не показал стабильной эффективности.

Этот результат подтверждает известную закономерность: RL с чёткой наградой (правильный ответ) эффективен для структурированных задач, тогда как итеративное самоисправление без внешнего сигнала часто приводит к ухудшению или зацикливанию.

Практические выводы

PerfReasoning вскрывает фундаментальное ограничение современных LLM: они могут убедительно рассуждать о производительности, но не способны надёжно строить рабочие аналитические модели. Для инженеров и исследователей это означает, что генерация кода для моделирования производительности остаётся задачей, требующей человеческого контроля.

Бенчмарк будет опубликован в открытом доступе, что позволит отслеживать прогресс в этой области. Для разработчиков AI-инструментов для аппаратного дизайна PerfReasoning может стать важным ориентиром при оценке новых моделей.

Источники
Оригинальная публикация: arXiv:2609.04476 — PerfReasoning: How Well Do LLMs Reason on Hardware Performance? (https://arxiv.org/abs/2609.04476)