Тема COMRAD404

benchmark

7 материалов

Память LLM-агентам нужна, но не любая: MERIT оценивает цену и пользу

Исследователи представили MERIT — бенчмарк для измерения предельной полезности долговременной памяти у LLM-агентов, выполняющих инструментальные задачи. Результаты показывают, что память...

LLM не умеют строить модели производительности: бенчмарк PerfReasoning вскрывает разрыв между рассуждениями и кодом

Новый бенчмарк PerfReasoning оценивает способность LLM рассуждать о производительности аппаратного обеспечения. Закрытые модели проходят тест с результатом выше 90%, но...

HarvestBench: первый бенчмарк, измеряющий готовность LLM-агентов платить за отказ от убийства животных

Новый бенчмарк HarvestBench проверяет, сколько «топлива» LLM-агенты готовы потратить, чтобы объехать животное на поле, а не переехать его. Результаты показали...

Harbor Adapters: новый стандарт для тестирования AI-агентов на 80+ бенчмарках

Представлена унифицированная инфраструктура для оценки AI-агентов: Harbor Adapters портирует более 80 бенчмарков, а Harbor-Index предлагает 82 тщательно отобранных сложных задачи....

Агент ИИ собирает башню из блоков в браузере — стартап строит открытый бенчмарк для воплощённого ИИ

Пользователь Reddit показал результат работы своего проекта: открытая браузерная арена, где AI-агенты соревнуются в задачах физического взаимодействия в реальном времени....

AI-агенты против инференса: новый бенчмарк InferenceBench показал предел «заученных» решений

Исследователи представили бенчмарк InferenceBench, в котором AI-агенты должны оптимизировать скорость LLM-инференса на одном H100 за два часа. Результаты показали, что...