Тема COMRAD404

agents

17 материалов

LLM-агенты получат систему предварительной верификации: новый подход к предотвращению «тихих» ошибок

Исследователи предлагают проверять действия LLM-агента до их выполнения, чтобы избежать «тихих» ошибок. Метод показал 95,8% точности для shell-команд и снизил...

RIPPLE: новый метод адаптации промптов для синтеза исполняемых рабочих процессов

Исследователи представили RIPPLE — метод, разделяющий локализацию правок промптов и проверку их безопасности после композиции. Алгоритм повышает успешность валидации до...

ИИ-агенты учатся изучать среду до получения задач: новый подход без syllabus

Исследователи формализовали задачу предварительной подготовки среды без знания целевых заданий. Мета-агент с архивом превзошёл фиксированные методы на пяти из шести...

Память LLM-агентам нужна, но не любая: MERIT оценивает цену и пользу

Исследователи представили MERIT — бенчмарк для измерения предельной полезности долговременной памяти у LLM-агентов, выполняющих инструментальные задачи. Результаты показывают, что память...

Google GTIG: ИИ-агенты взломали облачную инфраструктуру и собрали учетные данные за шесть часов

Google Threat Intelligence Group (GTIG) зафиксировала прецедент: злоумышленники использовали мультиагентный фреймворк для полного цикла атаки на облачный ресурс — от...

HarvestBench: первый бенчмарк, измеряющий готовность LLM-агентов платить за отказ от убийства животных

Новый бенчмарк HarvestBench проверяет, сколько «топлива» LLM-агенты готовы потратить, чтобы объехать животное на поле, а не переехать его. Результаты показали...