OpenAI выпустила system card для o1: что известно о проверках безопасности модели рассуждений
OpenAI опубликовала system card для o1 и o1-mini: документ описывает red teaming, оценки frontier-рисков и ограничения перед выпуском моделей.
Редактор по регулированию и безопасности
Анна Лебедева ведёт материалы COMRAD404 о регулировании и рисках: от новых требований к разработчикам до споров об авторском праве, приватности и маркировке синтетического контента.
В центре её разборов — первичные документы, область действия правил и реальные последствия для компаний и пользователей. Формальные нормы отделяются от рекомендаций, проектов и политических заявлений.
OpenAI опубликовала system card для o1 и o1-mini: документ описывает red teaming, оценки frontier-рисков и ограничения перед выпуском моделей.
GitHub добавил в repository rulesets правило, которое блокирует слияние pull request, пока обнаруженные secret scanning alerts не будут разрешены. Функция...
По данным TechCrunch со ссылкой на Bloomberg, китайская AI-лаборатория Moonshot AI рассчитывает выйти на $2 млрд годового темпа выручки к...
OpenAI связывает галлюцинации языковых моделей не только с архитектурой LLM, но и с тем, как индустрия измеряет качество ответов: тесты...
Проект trynix.dev позволяет запустить любой пакет из истории nixpkgs за последние 13 лет прямо в браузере — без установки Nix...
Google представила ToolGrad — фреймворк, который генерирует датасеты для обучения ИИ-агентов, переворачивая стандартный подход: сначала создаётся цепочка вызовов инструментов, а...
Исследователи из TII представили бенчмарк Alyah для оценки понимания эмиратского диалекта арабского языка. Тестирование 53 моделей показало, что даже лучшие...
История Mythos показывает: в кибербезопасности важен не только уровень языковой модели, но и вся система вокруг неё. Разбираем, почему открытые...
Руководитель отдела alignment science Anthropic Эван Хубингер публично признал, что вероятность гибели человечества от ИИ превышает 10% в ближайшие десять...
Выпущена версия 3.22 корпоративной платформы GitHub Enterprise Server. В релизе — обновления для управления командами, правила репозиториев с гибкими исключениями...
Новый анализ OpenAI выявил системные проблемы в популярном бенчмарке SWE-Bench Pro. Компания утверждает, что значительная часть результатов на тестах генерации...
Компания Anthropic запускает грантовую программу на $5 млн для создания открытых бенчмарков и оценок влияния ИИ-ассистентов на психологическое состояние пользователей....