LLM не умеют строить модели производительности: бенчмарк PerfReasoning вскрывает разрыв между рассуждениями и кодом
Новый бенчмарк PerfReasoning оценивает способность LLM рассуждать о производительности аппаратного обеспечения. Закрытые модели проходят тест с результатом выше 90%, но написание аналитического кода для моделей производительности даётся им значительно хуже — средний показатель успеха...
Открыть материал →
