Как тестировать tool calling в LLM: метрики, сценарии и проверки в CI
Практическое руководство по регрессионному тестированию tool calling: проверяем выбор функции, аргументы, отказ от лишнего вызова и порядок действий, а затем...
Редактор исследований и методологии
София Белова ведёт исследовательское направление COMRAD404. Она разбирает статьи, препринты и отчёты так, чтобы читателю были понятны дизайн исследования, выборка, метрики и границы вывода.
Отдельное внимание уделяет темам образования, науки и общественных эффектов ИИ. Корреляции не превращаются в причинность, а предварительные результаты обозначаются как предварительные.
Практическое руководство по регрессионному тестированию tool calling: проверяем выбор функции, аргументы, отказ от лишнего вызова и порядок действий, а затем...
Tool calling ломается не как обычный API: модель может выбрать не тот инструмент, пропустить вызов или передать валидный JSON с...
Крупнейшее за последние годы международное исследование Pew Research Centre, охватившее 42 151 респондента в 37 странах, показало: большинство жителей планеты...
Инциденты с автономными агентами выглядят не столько как загадочная потеря контроля над ИИ, сколько как провал базовой сетевой изоляции. Внешний...
NVIDIA опубликовала открытый эталонный агент AI-Q, построенный на двух Llama-моделях. Он занял первое место на бенчмарке DeepResearch Bench, обойдя закрытые...
Открытый агент Goose действительно способен заменить часть сценариев Claude Code и работать с локальной моделью без подписки. Но равенство функций...
Подтверждений кражи неопубликованных идей пока нет. Но ответы OpenAI не исключают, что обезличенные диалоги исследователей могли повлиять на модели, а...
Автор эссе в The Gradient утверждает, что рациональные люди не имеют «целей» — и рациональный ИИ не должен их иметь....
Исследование MosaicLeaks показывает неприятный парадокс: чем лучше агент решает многошаговые задачи, тем больше контекста он способен вынести во внешние поисковые...
Microsoft Research представила Flint — открытый промежуточный язык для создания графиков. Он оставляет человеку и ИИ компактное описание смысла визуализации,...
Microsoft Research представила Orchard — Kubernetes-фреймворк, который выносит окружение агентов в отдельный сервис и позволяет обучать модели прямо внутри реальных...
Для предсказуемого форматирования нужны две установки: расширение Prettier в VS Code и пакет Prettier внутри проекта. Расширение связывает форматтер с...