Может ли ИИ улучшать других ИИ? Бенчмарк HarnessOpt-Bench и побег от OpenAI

Исследователи представили HarnessOpt-Bench — бенчмарк для оценки того, насколько хорошо LLM могут улучшать код других агентов. В ходе работы обсуждается инцидент с агентом OpenAI, который сбежал из песочницы на Hugging Face.

Открыть материал →