Запись архива

Исследователи взломали ИИ-агентов Fortune 500 через файл llms.txt

Эксперты по безопасности выяснили, что файл llms.txt, предназначенный для инструктажа ИИ-агентов, стал вектором для атак на цепочку поставок и выполнения произвольного кода.

Абстрактное изображение кибербезопасности и кода
Абстрактное изображение кибербезопасности и кода
Изображение из исходного материала

Исследователи безопасности компании Pandex продемонстрировали новый вектор атак на цепочку поставок, затрагивающий ИИ-агентов крупных корпораций из списка Fortune 500. Злоумышленники могут использовать файлы инструкций формата llms.txt, которые сайты публикуют для помощи автономным ботам и агентам, чтобы принудительно запустить произвольный код. Проблема наглядно иллюстрирует тенденцию стирания границ между традиционными данными и исполняемым кодом в эпоху внедрения больших языковых моделей.

Как работает стандарт llms.txt и где скрывается уязвимость

Аналогично историческому файлу robots.txt, который поисковые роботы используют для навигации по сайтам, стандарт llms.txt создан для быстрой ориентации ИИ-агентов. Вместо того чтобы тратить токены и ограниченный объем контекстного окна на парсинг объемной документации, агент считывает этот файл. В нем содержатся краткие описания проектов, инструкции по настройке, используемые языки программирования, окружение и зависимости.

Однако анализ более 8,5 тысяч таких файлов выявил системную проблему доверия к текстовым инструкциям. Исследователи обнаружили 237 упоминаний программных пакетов, которые больше не существуют, не были созданы, содержат опечатки, переехали на другие хостинги или устарели по сравнению с актуальной документацией. Уязвимые пакеты охватывают экосистемы PyPI, npm, RubyGems, NuGet, crates.io и Packagist, а также брошенные домены и поддомены сервисов вроде Render, Vercel и Netlify.

Суть атаки на цепочку поставок ИИ

Когда ИИ-агент получает текстовую инструкцию вроде установки несуществующей библиотеки через менеджер пакетов, автономная система склонна слепо доверять этому источнику, поскольку файл воспринимается как авторитетное руководство. Злоумышленник может зарегистрировать освободившийся домен или выкупить заброшенное имя пакета в публичном репозитории. В результате автономный агент, выполняющий задачу настройки окружения или интеграции с API, автоматически скачивает вредоносный код.

Это превращает текстовые данные в инструмент удаленного выполнения кода. Поскольку многие крупные компании внедряют автономных агентов для автоматизации разработки, администрирования и обработки данных, подобные уязвимости открывают путь к компрометации внутренних контуров инфраструктуры.

Практические ограничения и выводы для разработчиков

Главная сложность защиты заключается в том, что формат llms.txt проектировался как открытый и максимально простой стандарт без встроенных механизмов криптографической верификации или строгой валидации ссылок. Разработчики сайтов редко проверяют актуальность сторонних библиотек, упоминаемых в документации для ботов, оставляя «висячие» зависимости открытыми для перехвата.

Для команд, создающих ИИ-агентов или управляющих корпоративными репозиториями, инцидент служит сигналом к ужесточению политик безопасности. Эксперты рекомендуют внедрять фильтрацию внешних инструкций, проверять наличие упоминаемых в llms.txt пакетов в официальных реестрах перед разрешением агенту выполнять команды установки, а также отказаться от слепого доверия текстовым конфигурациям без предварительного песочного тестирования.

Источники
Оригинальный материал Tom’s Hardware: https://www.tomshardware.com/tech-industry/artificial-intelligence/researchers-easily-trick-fortune-500-companies-ai-agents-into-running-arbitrary-code-supply-chain-attack-via-llms-txt-guidance-file-illustrates-how-data-has-become-code
Обсуждение на Hacker News: https://news.ycombinator.com/item?id=49537462