Redactle запустил лидерборд LLM: модели сравнивают по игре в угадывание статей
Redactle опубликовал лидерборд для языковых моделей: они угадывают скрытые заголовки статей, а результат считается по числу лишних ходов и стоимости.
Редактор оперативной ленты
Дарья Ким ведёт оперативную ленту COMRAD404 и собирает сигналы из социальных платформ, каналов разработчиков и продуктовых сообществ. Её задача — быстро определить, где начинается новость и заканчивается пересказ чужого поста.
При подготовке публикаций сверяет первоисточник, время события, доступность функции и контекст обсуждения. Неподтверждённые детали в материалы не попадают.
Redactle опубликовал лидерборд для языковых моделей: они угадывают скрытые заголовки статей, а результат считается по числу лишних ходов и стоимости.
NVIDIA опубликовала разбор speculative decoding как части совместного проектирования LLM: малый draft-модель предлагает токены, большая модель проверяет их параллельно, а...
Пользователи Reddit обсуждают главный bottleneck долгоживущих агентов — управление памятью и состоянием. Вместо бесконечного расширения контекстного окна предлагается использовать stateful...
Reddit-сообщество r/artificial обсуждает фундаментальные заблуждения вокруг ИИ. Опытные инженеры сходятся: главные проблемы — не в архитектуре, а в данных, метриках...
Эксперты по безопасности выяснили, что файл llms.txt, предназначенный для инструктажа ИИ-агентов, стал вектором для атак на цепочку поставок и выполнения...
Инструмент мутационного тестирования Flawd запущен как единый бинарник, работающий локально. Поддерживает Python, JS, TS, Go и Rust, не отправляет код...
На GitHub появился Markdown Gatekeeper — CLI-инструмент, который помогает проектам с Claude, Codex и другими агентами не плодить конкурирующие «актуальные»...
Стартап AfterQuery, специализирующийся на тренировке ИИ-моделей с привлечением профильных специалистов, стал единорогом за рекордные 5 месяцев с момента Series A....
Проект Compilr.dev Studio предлагает превратить AI-агента в архитектора проекта, который записывает цели, решения, риски и требования в виде связного графа,...
Исследователи измерили задержку при отключении сетевого доступа у ИИ-агента во время выполнения задачи. Результат — 127 миллисекунд.
На GitHub опубликована спецификация API Delta Manifest v1: JSON-манифест для описания изменений API в формате, который могут читать скрипты, IDE-агенты...
Новый метод защиты LLM от промпт-инъекций — Semantic Overlays. Небольшие обученные адаптеры на замороженной модели меняют то, как она воспринимает...