Оперативная лента ИИ-сигналов

214 материалов

Короткие проверки популярных AI-сигналов из Telegram, Reddit, X и YouTube: что произошло, чему верить и почему это важно.

Схема автономной работы AI-агента с фазой аудита и отказом в сертификации

Автономный AI-агент работал 4,5 дня и отказался сертифицировать себя сам

Разработчик запустил один промпт в AI-агент на воскресенье, а через четыре с половиной дня агент корректно отказался сертифицировать собственную работу. Эксперимент с открытым протоколом...

Открыть материал →
Схема бенчмарка HarnessOpt-Bench для оценки рекурсивного улучшения ИИ

Может ли ИИ улучшать других ИИ? Бенчмарк HarnessOpt-Bench и побег от OpenAI

Исследователи представили HarnessOpt-Bench — бенчмарк для оценки того, насколько хорошо LLM могут улучшать код других агентов. В ходе работы обсуждается инцидент с агентом OpenAI,...

Открыть материал →
Скриншот страницы ThunderPhone v2 с описанием архитектуры и цен

ThunderPhone v2: новая архитектура для голосового ИИ без трёхшагового пайплайна

ThunderPhone запустил v2 с альтернативой классическому пайплайну «транскрипция → LLM → TTS», используя несколько моделей транскрипции и прямую подачу аудио в LLM. Цены —...

Открыть материал →
Редакционная обложка COMRAD404: Почему Gemini и Perplexity чаще ссылаются на YouTube, чем ChatGPT и Claude: структурное объяснение

Почему Gemini и Perplexity чаще ссылаются на YouTube, чем ChatGPT и Claude: структурное объяснение

Пользователи Reddit заметили, что Gemini и Perplexity значительно чаще, чем ChatGPT или Claude, цитируют YouTube-видео в ответах на рекомендательные и инструкционные запросы. Обсуждается структурная...

Открыть материал →
Редакционная обложка COMRAD404: GLM-5.3-Flash: Z.ai представила первую открытую версию новой архитектуры с гибридным вниманием и FP8

GLM-5.3-Flash: Z.ai представила первую открытую версию новой архитектуры с гибридным вниманием и FP8

На Reddit обсуждают релиз GLM-5.3-Flash — первую открытую модель Z.ai на новой архитектуре glm5_next. 320B параметров, 18B активируемых, гибридное внимание (линейное + sparse) и...

Открыть материал →
Редакционная обложка COMRAD404: Бенчмарк агентных фреймворков: AutoGen, CrewAI, LangGraph и MetaGPT провалили строгий тест на Rust-коде

Бенчмарк агентных фреймворков: AutoGen, CrewAI, LangGraph и MetaGPT провалили строгий тест на Rust-коде

Пользователь Reddit протестировал пять AI-фреймворков на задаче написания Rust-мидлвара с тремя жёсткими ограничениями. Только его собственная система прошла проверку. Результаты вызвали дискуссию о проблемах...

Открыть материал →
Интерфейс Keenable — веб-поисковый API для AI-агентов с SQL-подобным синтаксисом и бенчмарком NEEDLE

Запущен Keenable — поисковый API для AI-агентов с SQL-интерфейсом и индексом 100B+ страниц

На Hacker News представлен Keenable — веб-поисковый API, оптимизированный для AI-агентов. Проект использует собственный индекс из более чем 100 миллиардов страниц, предлагает низкую задержку...

Открыть материал →
Редакционная обложка COMRAD404: Эксперимент: ChatGPT, Claude и Gemini уличили друг друга в галлюцинациях в общем чате

Эксперимент: ChatGPT, Claude и Gemini уличили друг друга в галлюцинациях в общем чате

Пользователь Reddit запустил три LLM в одном чате для решения сложной задачи. Модели начали исправлять ошибки друг друга, выявив взаимные галлюцинации. Результат — идеальный...

Открыть материал →