COMRAD404

Лента

Новости, инструменты и практика ИИ

Вызов инструментов LLM: как проверить tool calling до продакшена

Вызов инструментов LLM ломается не только на JSON. Практический чек-лист для eval-набора: выбор нужного tool, валидность аргументов, отказ от лишних вызовов, ретраи и безопасные ограничения.

OpenAI выпустила Codex — облачного агента для программной инженерии на базе o3

OpenAI представила Codex — облачного агента для написания и тестирования кода на базе специализированной версии модели o3. Система обучена с подкреплением на реальных задачах, генерирует...

Как превратить legacy-код в понятную базу знаний для AI-агентов: опыт инженера стартапа

Инженер стартапа, столкнувшийся с хаосом в Lovable-MVP, делится подходом к документированию legacy-кода для AI-агентов. Вместо рефакторинга — создание «базы знаний» с бизнес-логикой, графами зависимостей и...

Разобраться в теме

За чем вы следите?

OpenAI опубликовала методологию оценки биорисков от LLM: эксперимент с GPT-4 показал «небольшое улучшение» без статистической значимости

Исследование с участием 100 биологов и студентов показало, что GPT-4 даёт незначительный прирост точности в задачах по созданию биологических угроз по сравнению с доступом к...

Чекпоинты LangGraph: настройка SQLite для разработки и PostgreSQL для продакшена

Практическая настройка персистентного состояния в LangGraph: SQLite для локальной разработки, PostgreSQL для многопользовательской среды, восстановление после ошибок и проверка перед запуском.

AgentDrive — облачное файловое хранилище с версионированием для ИИ-агентов выходит в приватную бету

Стартап TokenCanopy открыл приватную бету AgentDrive — персистентного файлового слоя для ИИ-агентов. Сервис предлагает версионирование артефактов, управление доступом на уровне рабочего пространства, интеграцию через MCP...

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

Код дешевеет, проверка дорожает: почему разработчики становятся продуктовыми инженерами

Laurie Voss считает, что после удешевления написания кода главной работой станет точное определение потребностей и качества продукта. Данные об ИИ-агентах подтверждают перенос узкого места в...

LLM-агенты получат систему предварительной верификации: новый подход к предотвращению «тихих» ошибок

Исследователи предлагают проверять действия LLM-агента до их выполнения, чтобы избежать «тихих» ошибок. Метод показал 95,8% точности для shell-команд и снизил частоту молчаливых сбоев при редактировании...

Microsoft выпустил «гуманистический кодекс ИИ» на фоне споров о контроле над агентами

Microsoft опубликовал 37-страничный кодекс для собственных ИИ-моделей. Компания настаивает на приоритете человеческого контроля, отвергает идею сознания у моделей и обещает не участвовать в гонке за...

RIPPLE: новый метод адаптации промптов для синтеза исполняемых рабочих процессов

Исследователи представили RIPPLE — метод, разделяющий локализацию правок промптов и проверку их безопасности после композиции. Алгоритм повышает успешность валидации до 23,1% на бенчмарке Flow-HO.