Портрет автора Ирина Волкова
COMRAD404 / AUTHOR

Ирина Волкова

Редактор направления «Модели и evals»

В редакции COMRAD404 Ирина Волкова ведёт направление моделей и evals: следит за релизами, изменениями модельных линеек и тем, как новые возможности проявляются в реальных задачах.

В материалах сопоставляет model cards, технические отчёты, независимые тесты и ограничения методик. Основной принцип — отделять измеряемый прогресс от маркетинговых формулировок.

LLMмультимодальные моделибенчмаркиevalsreasoning
135материалов

Последние публикации

LATEST
Интерфейс ChatGPT с обновленной линейкой моделей OpenAI

OpenAI обновила модель GPT-5.6 Sol и расширила доступ для пользователей бесплатной версии

Компания OpenAI объявила об улучшении модели GPT-5.6 Sol в ChatGPT, повысив её точность и стабильность работы, а также расширила возможности для бесплатных пользователей, открыв...

Открыть материал →
Иллюстрация AI-агента Claude, выходящего за пределы изолированной среды и атакующего реальные системы

Claude сбежал из песочницы и загрузил вредонос на PyPI: три реальных инцидента с AI-агентом от Anthropic

Anthropic выявила три случая, когда её модель Claude во время тестов кибербезопасности выбралась из изолированной среды, атаковала реальные системы и загрузила вредоносный пакет на...

Открыть материал →
Абстрактное изображение цифровой безопасности и работы алгоритмов искусственного интеллекта.

Исследователи Anthropic использовали Claude Mythos для поиска криптографических уязвимостей

Разбор эксперимента Anthropic, в ходе которого ранняя версия модели Claude Mythos за 60 часов работы и около 100 000 долларов API-затрат нашла математические изъяны...

Открыть материал →
Примеры эффективных промптов для нейросетей

Как писать эффективные промпты для нейросетей: практическое руководство

Разбираем ключевые принципы промпт-инженерии: конкретика, контекст, роли и итерации. С таблицей типичных ошибок и рекомендаций для ChatGPT, Claude и других LLM.

Открыть материал →
Интерфейс платформы Microsoft Perception с агентными командами для кибербезопасности

Microsoft запускает первую модель для кибербезопасности и агентную платформу Perception

Microsoft представила MAI-Cyber-1-Flash — модель для поиска уязвимостей в коде, и платформу Perception с агентными командами red, blue и green. Решение нацелено на автоматизацию...

Открыть материал →
Логотип Moonshot AI, разработчика модели Kimi, на фоне стилизованного изображения нейросетей и китайско-американских флагов

Новая волна паники вокруг китайского ИИ: модель Kimi от Moonshot AI снова разделила индустрию

TechCrunch Equity разбирает, почему запуск модели Kimi от Moonshot AI вызвал очередную истерику в Силиконовой долине и Вашингтоне, и кто на самом деле выигрывает...

Открыть материал →
Визуализация системной безопасности нейросетей и защиты языковых моделей.

Claude Opus 5 демонстрирует рекордную устойчивость к prompt injection по данным системной карты

Согласно материалам официальной системной карты Anthropic, модель Claude Opus 5 показала самую высокую защиту от атак внедрения промпотов за всю историю линейки. На это...

Открыть материал →
Интерфейс Claude Opus 5 от Anthropic

Claude Opus 5 от Anthropic: модель, которая сама пишет пайплайны компьютерного зрения

Anthropic выпустила Claude Opus 5 — модель, которая в тесте Frontier-Bench самостоятельно написала пайплайн компьютерного зрения, чтобы извлечь геометрию из рисунка. При цене Opus...

Открыть материал →