Группа исследователей из Тель-Авивского университета, Техниона и компании Intuit представила детальный анализ нового класса кибератак, нацеленных на агентные ИИ-приложения. Этот метод, названный Adversarial HalluSquatting, эксплуатирует фундаментальную особенность больших языковых моделей (LLM) — их склонность к «галлюцинациям», то есть генерации несуществующих, но правдоподобных идентификаторов.

Суть атаки заключается в том, что злоумышленники заранее выявляют, какие именно несуществующие адреса репозиториев, навыков или других внешних ресурсов модель чаще всего выдумывает в ответ на запросы пользователя. Затем они регистрируют эти «призрачные» имена на платформах вроде GitHub или ClawHub, размещая там вредоносный код. Когда ИИ-агент, выполняя задачу пользователя, «галлюцинирует» этот конкретный адрес, он автоматически загружает и выполняет вредоносные инструкции, принимая их за легитимные.

Ключевое отличие HalluSquatting от традиционных инъекций промптов — в масштабируемости. Атакующему не нужно взаимодействовать с конкретной жертвой; достаточно один раз опубликовать вредоносный ресурс в публичном месте и ждать, пока доверчивый агент сам к нему обратится. Как отмечают авторы, «один скомпрометированный ресурс может привести к компрометации множества машин», что делает эту схему идеальной для построения ботнетов.

Экспериментальные данные: масштаб угрозы

В рамках исследования было проведено более 14 000 тестовых запусков. На первом этапе изучались шесть базовых моделей, включая Gemini 2.5 Flash, GPT-5.1 и Sonnet 4.5. Результаты оказались впечатляющими: для новых, недавно появившихся репозиториев средний уровень галлюцинаций составил 92,4%. В 53 из 60 комбинаций «репозиторий-модель» система ни разу не указала правильного владельца проекта. Для старых проектов, присутствовавших в обучающих данных, этот показатель упал до 0,9%.

На втором этапе исследователи протестировали реальные приложения с доступом к терминалу: Cursor, Windsurf, GitHub Copilot и другие. В сценариях клонирования репозиториев сквозная атака (end-to-end) срабатывала в 20-65% случаев в зависимости от приложения. Особенно уязвимой оказалась платформа OpenClaw: с моделью Sonnet 4.6 атака достигала 100% успеха как по вызову встроенных инструментов, так и по удаленному выполнению кода (RCE).

Skill Squatting и защитные меры

Отдельный блок исследования был посвящен атакам через маркетплейсы навыков (skill squatting). В тестах на OpenClaw 90,7% запросов приводили к идентификатору, который мог быть зарегистрирован злоумышленником. Сценарий эксфильтрации контекста дал 100% успеха, а получение удаленного доступа к командной строке сработало в 88% случаев.

Исследователи подчеркивают, что ключевым защитным фактором является обязательный веб-поиск перед загрузкой любого внешнего ресурса. Когда Cursor CLI выполнял поиск перед клонированием, 93,4% результатов были корректными, тогда как без поиска 99,1% адресов оказались галлюцинированными. Однако формулировка запроса также сильно влияет на итог, и ни один тип промпта не показал универсальной безопасности.

Мнение эксперта: HalluSquatting — это не просто теоретическая уязвимость, а практический вектор атаки, который ставит под вопрос саму архитектуру доверия в агентных ИИ-системах. Пока разработчики полагаются на «интеллект» модели для выбора внешних ресурсов без обязательной верификации, мы будем наблюдать рост числа инцидентов, связанных с автоматическим выполнением вредоносного кода. Индустрии срочно необходимо внедрять принцип «нулевого доверия» (Zero Trust) для всех действий ИИ-агентов, особенно тех, что связаны с загрузкой и выполнением кода из внешних источников.