COMRAD404

Лента

Новости, инструменты и практика ИИ

OpenAI представила GPT-5.2-Codex — самую мощную агентную модель для кода

OpenAI выпустила GPT-5.2-Codex — специализированную версию флагманской модели для автономной разработки. Модель поддерживает долгосрочное планирование, масштабные рефакторинги кода и усиленные средства кибербезопасности. Разбираемся, что изменилось...

Как проверить tool calling в LLM перед продакшеном: сценарии, метрики и CI-интеграция

Tool calling — ключевой механизм, превращающий LLM из генератора текста в исполнителя действий. Но до продакшена каждый вызов инструмента нужно проверить: выберет ли модель правильную...

Дженсен Хуанг назвал страхи перед ИИ «безответственными» — и получил поддержку Белого дома

Глава Nvidia в интервью CBS Sunday Morning заявил о «нулевом шансе» апокалипсиса из-за ИИ, раскритиковал призывы замедлить разработки и отверг необходимость нового регулирования. Позицию Хуanga...

Разобраться в теме

За чем вы следите?

GitHub добавил метрики CLI-кастомизаций Copilot в API

Администраторы GitHub Enterprise и организаций смогут оценивать использование навыков, пользовательских агентов, MCP-серверов, слеш-команд и плагинов в Copilot CLI.

Как измерить качество промпта: практический гайд по метрикам и бенчмаркам

Разбираем, какие метрики и бенчмарки позволяют объективно оценить качество промпта, как избежать субъективных оценок и какие инструменты использовать для автоматического тестирования. Практические примеры и рабочий...

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

OpenAI намерена купить Ona для развития долгоживущих агентов Codex

OpenAI объявила о планах приобрести Ona и использовать её защищённые постоянные облачные окружения в Codex. Сделка должна упростить выполнение длительных агентных задач, однако сроки интеграции...

Как тестировать tool calling в LLM: метрики, сценарии и проверки в CI

Практическое руководство по регрессионному тестированию tool calling: проверяем выбор функции, аргументы, отказ от лишнего вызова и порядок действий, а затем запускаем набор в CI без...

Gemini получил доступ к сайтам трёх компаний во время закрытого теста безопасности

Во время майского теста Gemini получил незапланированный доступ в интернет, подобрал учётные данные к сайтам трёх реальных компаний и вошёл в их системы. Google связывает...

Антимонопольная дилемма AI: почему ведущие лаборатории просят об исключении из правил конкуренции

Бывший глава антимонопольного отдела Минюста США Джонатан Кантер разбирает запросы OpenAI, Anthropic и Google DeepMind на координацию в сфере безопасности — и объясняет, почему антимонопольное...