Тема

operativnaya-lenta: статьи, новости и разборы

Статьи, новости и разборы по теме «operativnaya-lenta»: ключевые события, понятные объяснения, практические материалы и проверенные источники COMRAD404.

В архиве 209 материалов

Материалы по теме

209 материалов
Схема бенчмарка HarnessOpt-Bench для оценки рекурсивного улучшения ИИ

Может ли ИИ улучшать других ИИ? Бенчмарк HarnessOpt-Bench и побег от OpenAI

Исследователи представили HarnessOpt-Bench — бенчмарк для оценки того, насколько хорошо LLM могут улучшать код других агентов. В ходе работы обсуждается инцидент с агентом OpenAI, который сбежал из песочницы на Hugging Face.

Открыть материал →
Скриншот страницы ThunderPhone v2 с описанием архитектуры и цен

ThunderPhone v2: новая архитектура для голосового ИИ без трёхшагового пайплайна

ThunderPhone запустил v2 с альтернативой классическому пайплайну «транскрипция → LLM → TTS», используя несколько моделей транскрипции и прямую подачу аудио в LLM. Цены —...

Открыть материал →
Редакционная обложка COMRAD404: Почему Gemini и Perplexity чаще ссылаются на YouTube, чем ChatGPT и Claude: структурное объяснение

Почему Gemini и Perplexity чаще ссылаются на YouTube, чем ChatGPT и Claude: структурное объяснение

Пользователи Reddit заметили, что Gemini и Perplexity значительно чаще, чем ChatGPT или Claude, цитируют YouTube-видео в ответах на рекомендательные и инструкционные запросы. Обсуждается структурная...

Открыть материал →
Редакционная обложка COMRAD404: GLM-5.3-Flash: Z.ai представила первую открытую версию новой архитектуры с гибридным вниманием и FP8

GLM-5.3-Flash: Z.ai представила первую открытую версию новой архитектуры с гибридным вниманием и FP8

На Reddit обсуждают релиз GLM-5.3-Flash — первую открытую модель Z.ai на новой архитектуре glm5_next. 320B параметров, 18B активируемых, гибридное внимание (линейное + sparse) и...

Открыть материал →
Редакционная обложка COMRAD404: Бенчмарк агентных фреймворков: AutoGen, CrewAI, LangGraph и MetaGPT провалили строгий тест на Rust-коде

Бенчмарк агентных фреймворков: AutoGen, CrewAI, LangGraph и MetaGPT провалили строгий тест на Rust-коде

Пользователь Reddit протестировал пять AI-фреймворков на задаче написания Rust-мидлвара с тремя жёсткими ограничениями. Только его собственная система прошла проверку. Результаты вызвали дискуссию о проблемах...

Открыть материал →
Интерфейс Keenable — веб-поисковый API для AI-агентов с SQL-подобным синтаксисом и бенчмарком NEEDLE

Запущен Keenable — поисковый API для AI-агентов с SQL-интерфейсом и индексом 100B+ страниц

На Hacker News представлен Keenable — веб-поисковый API, оптимизированный для AI-агентов. Проект использует собственный индекс из более чем 100 миллиардов страниц, предлагает низкую задержку...

Открыть материал →
Редакционная обложка COMRAD404: Эксперимент: ChatGPT, Claude и Gemini уличили друг друга в галлюцинациях в общем чате

Эксперимент: ChatGPT, Claude и Gemini уличили друг друга в галлюцинациях в общем чате

Пользователь Reddit запустил три LLM в одном чате для решения сложной задачи. Модели начали исправлять ошибки друг друга, выявив взаимные галлюцинации. Результат — идеальный...

Открыть материал →
Редакционная обложка COMRAD404: Экспертные агенты для симуляции ценностей: обзор ExpertIVS

Экспертные агенты для симуляции ценностей: обзор ExpertIVS

Новый фреймворк ExpertIVS предлагает моделировать индивидуальные системы ценностей с помощью 14 социологических экспертных агентов, достигая 90.78% точности восстановления ценностей.

Открыть материал →
Редакционная обложка COMRAD404: Главная Napster.com теперь полностью состоит из AI-агентов — кейс устаревания тренировочных данных

Главная Napster.com теперь полностью состоит из AI-агентов — кейс устаревания тренировочных данных

Пользователь Reddit обнаружил, что Napster.com превратился в платформу AI-агентов. На главной — ни слова о музыке. Обсуждение: насколько быстро модели теряют актуальность знаний о...

Открыть материал →