COMRAD404

Лента

Новости, инструменты и практика ИИ

Microsoft Research предложила выносить ИИ-инференс с роботов на внешние GPU

Microsoft Research сравнила бортовой, периферийный и облачный инференс в задачах мобильной робототехники. По данным авторов, внешние GPU ускоряют планирование и помогают экономить заряд, но делают...

Koreshield предложил слой контроля действий для ИИ-агентов поддержки

Koreshield заявляет, что проверяет сообщения, извлечённые данные и вызовы инструментов до выполнения действий ИИ-агентом. Пока возможности продукта описаны только его разработчиком и не подтверждены независимыми...

OpenAI привлекла независимую группу из девяти математиков для оценки ИИ-результатов

Независимая группа AGMAI будет консультировать OpenAI по проверке и публикации математических результатов, полученных с помощью ИИ. Участники не получают оплату от компании, однако их полномочия...

Разобраться в теме

За чем вы следите?

Nokia открыла AnyJev — слой для решений на базе LLM без дообучения

AnyJev превращает открытую языковую модель в классификатор с фиксированными вариантами ответа. Библиотека оценивает вероятности без генерации текста и предлагает два уровня калибровки.

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

GitHub Copilot 1.18.0 для JetBrains получил планы Codex и автоматические подтверждения

GitHub обновил Copilot для IDE JetBrains: агент научился автоматически подтверждать низкорисковые вызовы инструментов, возвращаться к предыдущим запросам с откатом правок и согласовывать план Codex до...

Как оценивать качество tool calling в LLM: метрики, сценарии и CI-проверки

Tool calling — ключевой механизм для AI-агентов, но без системной оценки он остаётся источником ошибок. Разбираем метрики, тестовые сценарии и интеграцию проверок в CI, опираясь...

Саймон Уиллисон и Джесси Винсент проведут встречу о кодинг-агентах в Сан-Франциско

14 октября 2026 года Саймон Уиллисон и Джесси Винсент проведут в Сан-Франциско неформальную сессию для разработчиков кодинг-агентов. Вместо докладов и продуктовых питчей организаторы предлагают обсуждать...

Контрактные тесты для tool calling: как ловить ошибки агентов до релиза

Контрактное тестирование проверяет три критичных слоя tool calling: выбор функции, аргументы и порядок вызовов. Разбираем набор сценариев, пороги для CI и способы отделить ошибку модели...

GitHub Copilot добавил поддержку OpenTelemetry для мониторинга работы агентов

GitHub Copilot теперь позволяет корпоративным администраторам экспортировать данные о работе агентов через OpenTelemetry. Настройка выполняется в managed-settings.json, а содержимое промптов и ответов по умолчанию не...

OpenAI расширила Trusted Access for Cyber моделями GPT-5.5 и GPT-5.5-Cyber

OpenAI добавила GPT-5.5 и специализированную GPT-5.5-Cyber в программу контролируемого доступа для проверенных специалистов по кибербезопасности. Публичных данных пока недостаточно, чтобы оценить преимущество новой модели в...