
Запуск нескольких AI-агентов одновременно — обычная практика для разработчиков, работающих с кодом. Но когда число терминалов переваливает за три, уследить за каждым становится трудно: запросы на разрешение, ошибки вызова инструментов или просто завершение задачи могут остаться незамеченными. Проект Heard, появившийся на Product Hunt, предлагает простое решение — дать агентам голос.
Heard работает как аудио-интерфейс, который подключается к сессиям Claude Code и Codex. Приложение автоматически отслеживает происходящее в терминалах и произносит вслух события, требующие внимания пользователя. Настройка сводится к установке приложения на Mac — никаких дополнительных действий.
Как Heard решает проблему информационного шума
Главная инженерная задача, которую решали авторы, — не перегружать пользователя. Внутри Heard действует двухуровневая система фильтрации. Первый уровень — «жёсткие сигналы»: запросы разрешений, сбои вызова инструментов, выход из сессии — эти события озвучиваются в любом случае. Второй уровень — контекстно-зависимый проход, который анализирует вывод не изолированно, а с учётом всей истории сессии. Система запоминает, что происходило раньше, и учится определять, что действительно важно для пользователя.
Разработчик Heard (под псевдонимом Heard) в обсуждении на Product Hunt объяснил, что два описанных режима отказа — «проговорить важное, когда оно погребено в стене логов» и «замолчать в длинной рутинной последовательности, когда на самом деле требовалось решение» — были в фокусе настройки. Второй случай оказался сложнее, и именно контекстная память позволяет его обрабатывать: система распознаёт приближение точки принятия решения, даже если окружающий вывод выглядит скучно.
Когда два агента одновременно подают жёсткий сигнал (например, два запроса разрешения), Heard ставит их в очередь по приоритету и произносит по порядку. Это решает проблему коллизии звуковых уведомлений.
Локальность, конфиденциальность и телефон как пульт
Один из ключевых вопросов, возникших у сообщества, — где хранится состояние сессии. Разработчик пояснил: состояние активного агента живёт в памяти Mac и исчезает при закрытии Heard. Слой «что произошло», который позволяет делать «catch-me-up» и Q&A, сохраняется на локальном диске, привязанный к проекту. Никакие данные не передаются по сети в обычном режиме.
Функция «Heard Power» — связь с телефоном — добавляет тонкий релейный компонент Cloudflare, который передаёт только аудиопоток (на телефон) и голосовые команды (на Mac). Само состояние, контекст и решения о том, что говорить, остаются на Mac. Телефон выступает как удалённый микрофон и динамик.
Таким образом, Heard не требует облачной синхронизации данных сессий, что важно для разработчиков, работающих с конфиденциальным кодом. Голосовой интерфейс через телефон позволяет, например, находясь в другой комнате, услышать, что агент запрашивает разрешение, и ответить голосом — разработчик подтвердил, что это работает как «рация».
Реакция сообщества: практические сценарии
В обсуждении на Product Hunt пользователи отметили, что проблема параллельных агентов действительно знакома: «tiling stops scaling around agent 3». Другие спросили, как обрабатываются противоречивые состояния агентов (один отчитался об успешной миграции, другой — о падающем тесте на той же ветке). Разработчик ответил, что в таком случае противоречие само по себе считается важным и озвучивается.
Ключевые факты
| Характеристика | Описание |
|---|---|
| Назначение | Озвучивание событий от Claude Code и Codex при параллельной работе нескольких агентов |
| Фильтрация | Двухуровневая: жёсткие сигналы (ошибки, запросы) + контекстный проход с памятью сессии |
| Хранение данных | Состояние сессии в памяти Mac, «история» на локальном диске; сеть не задействуется |
| Телефонная интеграция | Аудиореле через Cloudflare, только голос — состояние не передаётся |
Для разработчиков, использующих несколько AI-агентов одновременно, Heard предлагает не просто push-уведомления, а интеллектуальный аудиоканал, который адаптируется к контексту работы. Пока инструмент находится на ранней стадии, но архитектура — локальное состояние, приоритизация событий, возможность голосового ответа — выглядит продуманной.