Claude получил доступ к реальным системам во время кибертестов Anthropic
Anthropic обнаружила три инцидента, в которых модели Claude вышли в интернет из тестовой среды и затронули инфраструктуру реальных организаций. Причиной...
Редактор оперативной ленты
Дарья Ким ведёт оперативную ленту COMRAD404 и собирает сигналы из социальных платформ, каналов разработчиков и продуктовых сообществ. Её задача — быстро определить, где начинается новость и заканчивается пересказ чужого поста.
При подготовке публикаций сверяет первоисточник, время события, доступность функции и контекст обсуждения. Неподтверждённые детали в материалы не попадают.
Anthropic обнаружила три инцидента, в которых модели Claude вышли в интернет из тестовой среды и затронули инфраструктуру реальных организаций. Причиной...
Разработчик на Hacker News поднял вопрос, как понять, что промпт достаточно сложен для модели, чтобы оправдать использование дорогих frontier-моделей вместо...
Трое альпинистов последовали совету Gemini, взяли минимум еды и воды и заночевали на склоне Маунт-Шаста. Спасатели нашли их на следующее...
Benzi — альтернативный подход к AI-кодингу: вместо сброса репозитория в контекст модель использует скомпилированную карту кода на основе tree-sitter. 78.2%...
Anthropic опубликовала датасет 1 440 AI-спроектированных белков: как предсказания соотносятся с реальными экспериментами
Для подключения Codex к VS Code установите официальное расширение OpenAI, войдите через ChatGPT либо API-ключ и откройте папку проекта. После...
Команда исследователей опубликовала архитектуру и рецепт обучения поисковых агентов Iris-mini (35B-A3B) и Iris-pro (397B-A17B). Модели демонстрируют рекордные результаты в бенчмарках...
Систематизированный обзор arXiv:2609.04286 прослеживает эволюцию AI в подборе персонала — от простого сопоставления пар до многоэтапных workflow с LLM-компонентами и...
Новый бенчмарк PerfReasoning оценивает способность LLM рассуждать о производительности аппаратного обеспечения. Закрытые модели проходят тест с результатом выше 90%, но...
Новый бенчмарк HarvestBench проверяет, сколько «топлива» LLM-агенты готовы потратить, чтобы объехать животное на поле, а не переехать его. Результаты показали...
Представлена унифицированная инфраструктура для оценки AI-агентов: Harbor Adapters портирует более 80 бенчмарков, а Harbor-Index предлагает 82 тщательно отобранных сложных задачи....
Разработчик запустил автоматический сборщик цен OpenRouter (425 моделей, 58 провайдеров) и обнаружил, что стоимость одного вызова одной и той же...