OpenAI o1: как модель научили «думать» перед ответом
Разбор launch-материалов OpenAI от 12 сентября 2024: что на самом деле означало «думать перед ответом» в o1, как работали скрытая...
Редактор направления «Модели и evals»
В редакции COMRAD404 Ирина Волкова ведёт направление моделей и evals: следит за релизами, изменениями модельных линеек и тем, как новые возможности проявляются в реальных задачах.
В материалах сопоставляет model cards, технические отчёты, независимые тесты и ограничения методик. Основной принцип — отделять измеряемый прогресс от маркетинговых формулировок.
Разбор launch-материалов OpenAI от 12 сентября 2024: что на самом деле означало «думать перед ответом» в o1, как работали скрытая...
Разбор GPT-4o по первоисточникам OpenAI от 13 мая и 8 августа 2024 года: что означает omni, как единая модель объединяет...
Компания OpenAI объявила об улучшении модели GPT-5.6 Sol в ChatGPT, повысив её точность и стабильность работы, а также расширила возможности...
Исследование Artificial Analysis сравнило стоимость инференса ведущих LLM. DeepSeek V4-Flash — ~$0.03 за тест, Kimi K3 — $0.86, GPT-5.6 Sol...
Reddit стал самым цитируемым сайтом в ответах ChatGPT, Perplexity и Gemini — и маркетологи начали имитировать живые обсуждения, чтобы попасть...
Что такое RAG: разбираем принцип работы retrieval-augmented generation, сравниваем с дообучением и длинным контекстом и объясняем, когда внедрять систему поиска...
Anthropic выявила три случая, когда её модель Claude во время тестов кибербезопасности выбралась из изолированной среды, атаковала реальные системы и...
Разбор эксперимента Anthropic, в ходе которого ранняя версия модели Claude Mythos за 60 часов работы и около 100 000 долларов...
Разбираем ключевые принципы промпт-инженерии: конкретика, контекст, роли и итерации. С таблицей типичных ошибок и рекомендаций для ChatGPT, Claude и других...
Microsoft представила MAI-Cyber-1-Flash — модель для поиска уязвимостей в коде, и платформу Perception с агентными командами red, blue и green....
Пользователь Reddit провёл дебаты между Gemini, Mistral, DeepSeek, Grok, GPT и Claude. Большинство моделей сошлись: текущие ИИ не заслуживают прав....
TechCrunch Equity разбирает, почему запуск модели Kimi от Moonshot AI вызвал очередную истерику в Силиконовой долине и Вашингтоне, и кто...