News

Риски безопасности ИИ-агентов: когда злоумышленник перехватывает доступ агента

News | 28.08.2026

ИИ-агенты стремительно переходят из статуса экспериментальной технологии в категорию корпоративных решений. Они способны получать доступ к бизнес-приложениям, запрашивать базы данных, вызывать API, выполнять рабочие процессы, извлекать информацию и принимать решения от имени пользователей и организаций.

Это формирует новый вызов в сфере кибербезопасности.

Когда ИИ-агенту предоставляются легитимные учетные данные, права доступа, API, инструменты и доступ к конфиденциальной информации, злоумышленнику может даже не потребоваться напрямую компрометировать учетную запись администратора. Если манипуляции подвергается сам агент, нападающий потенциально может унаследовать тот уровень доступа, который агенту уже официально доверен.

В конце 2025 года компания Anthropic раскрыла данные о шпионской кампании GTG-1002, в ходе которой злоумышленник манипулировал системой Claude Code для автономного выполнения порядка 80–90% тактических операций. Эта кампания была связана с ИИ-системой, направляемой атакующим, а не с компрометацией корпоративного ИИ-агента. Тем не менее она продемонстрировала важную возможность: ИИ-системы способны связывать в единую цепочку разведку, эксплуатацию, использование учетных данных, горизонтальное перемещение и сбор данных на такой скорости и в таких масштабах, которые оператору-человеку сложно воспроизвести вручную.

Для предприятий, внедряющих агентный ИИ (agentic AI), это кардинально меняет оценку рисков.

Аутентификация устанавливает доверие. Поведение ИИ во время выполнения (runtime) определяет, не злоупотребляют ли этим доверием.

Главное

  • ИИ-агенты работают с реальными учетными данными и правами доступа. Агент, подвергшийся манипуляции, может использовать этот доступ, не вызывая стандартных ошибок аутентификации.
  • Злоумышленники могут подорвать доверие к агенту с помощью внедрения промптов (prompt injection), отравления контекста, компрометации инструментов и зависимостей или кражи учетных данных приложений.
  • IAM, EDR, SIEM, облачная телеметрия и ограничения (guardrails) для ИИ остаются необходимыми, однако наличие валидных учетных данных и санкционированных вызовов API не доказывает, что агент действует в рамках своих целевых задач.
  • Киберобман (Cyber deception) создает контролируемые возможности для генерации доказательств вредоносного поведения, когда агент обращается к honeytoken, следует по пути HoneyPath или взаимодействует с ложным активом.
  • Acalvio Deception Guardrails расширяют концепцию 360 Deception на среды выполнения агентного ИИ в качестве функционального модуля платформы ShadowPlex.

Как ИИ-агенты расширяют доверенную поверхность атак

Корпоративные ИИ-агенты сочетают в себе три возможности, которые традиционно существовали раздельно: идентификацию, автоматизацию и принятие решений.

Агент может проходить аутентификацию в корпоративных системах с использованием сервисной учетной записи или токенов API, извлекать информацию из множества источников и затем автономно определять, какие действия необходимо предпринять.

Это создает проблему безопасности, выходящую за рамки традиционной безопасности моделей ИИ.

Четыре характеристики, увеличивающие риски безопасности ИИ

Привилегированная учетная запись. ИИ-агенты обычно используют сервисные аккаунты, токены OAuth, ключи API или другие машинные учетные записи. Их полномочия могут охватывать сразу несколько систем, тогда как детализированный контроль за отдельными действиями остается неравномерным.

Полномочия на выполнение действий. В отличие от традиционного ПО, выполняющего строго заданную последовательность операций, ИИ-агенты могут запускать скрипты, запрашивать данные, изменять записи, отправлять сообщения, выделять ресурсы, вызывать API и активировать дополнительные рабочие процессы.

Зависимость от внешнего контекста и инструментов. Агентные процессы используют промпты, данные RAG, документы, API, плагины, серверы MCP и инструкции из других систем или от других агентов. Если доверенный источник информации компрометируется или отравляется, он может изменить поведение агента без смены его учетных данных.

Высокий объем активности в режиме реального времени (runtime). Для достижения одной цели агент может выполнять множество действий с использованием различных инструментов. Каждое отдельное действие может казаться санкционированным, даже если вся последовательность в совокупности представляет собой вредоносную активность.

Таким образом, вопрос безопасности выходит далеко за рамки того, безопасна ли модель ИИ сама по себе или валидна ли учетная запись. Защитникам необходимо понимать, где формируется доверие, как его можно подорвать и в какой момент злонамеренное использование становится видимым.

Таблица 1: Цепочка доверия ИИ-агента

Уровень доверия Чему доверяет предприятие Как можно подорвать доверие
Идентификация (Identity) Сервисные аккаунты, токены OAuth, ключи API и машинные учетные записи Кража учетных данных, избыточные права доступа или имперсонация учетной записи агента
Контекст (Context) Промпты, данные RAG, векторные базы данных, документы и базы знаний Отравление инструкций или доверенных данных с целью изменения решений агента
Выполнение (Execution) API, плагины, внешние инструменты, рабочие процессы и автоматизированные действия Компрометация инструмента или использование санкционированной возможности в несанкционированных целях
Среда выполнения (Runtime) Последовательность решений, вызовов инструментов и действий в реальном времени Объединение корректных по отдельности шагов в цепочку горизонтального перемещения, повышения привилегий, несанкционированного доступа или закрепления в системе

Четыре способа подрыва доверия к ИИ-агенту

Злоумышленникам не обязательно компрометировать саму модель ИИ. Они могут атаковать информацию, учетные записи, инструменты и поддерживающую инфраструктуру, которые влияют на работу агента.

Внедрение промптов (Prompt Injection)

Атаки класса Prompt Injection внедряют вредоносные инструкции в контент, обрабатываемый ИИ-агентом, такой как документы, электронные письма, веб-страницы, тикеты или другие внешние данные.

Вместо эксплуатации уязвимостей ПО в традиционном смысле нападающий пытается повлиять на то, как агент интерпретирует инструкции и определяет дальнейшие действия.

Отравление контекста (Context Poisoning)

Context Poisoning нацелен на информацию, на которую агент опирается при принятии решений.

Злоумышленники могут подменять данные в векторных базах данных, контенте RAG, хранилищах памяти, документах или других доверенных источниках знаний, чтобы агент получал ложную информацию и выполнял незапланированные действия.

Компрометация инструментов и цепочки поставок

Современные ИИ-агенты зависят от инструментов, плагинов, API, серверов MCP, библиотек и сторонних интеграций.

Компрометация одного из этих компонентов может внедрить вредоносное поведение в изначально доверенный рабочий процесс. Поскольку агент уже имеет разрешение на использование инструмента, вредоносные действия на первых порах могут напоминать легитимную активность.

Кража учетных данных и злоупотребление идентификацией

Нападающие могут похищать или несанкционированно использовать учетные данные приложений, ключи API, сервисные аккаунты, токены OAuth и другие машинные идентификаторы, связанные с ИИ-агентами.

В этом сценарии злоумышленник не обязательно манипулирует самим агентом. Вместо этого он использует учетную запись и полномочия, которыми агент уже обладает.

Эти векторы атак взаимосвязаны, но имеют различия. Специфические для ИИ манипуляции наиболее точно отражены в матрице MITRE ATLAS, тогда как возникающее в результате поведение в корпоративной сети может сопоставляться с MITRE ATT&CK.

Таблица 2: Сопоставление атак на доверие ИИ-агентам с матрицами MITRE

Атака на доверие Соответствующий фреймворк Важная специфика
Prompt Injection MITRE ATLAS: Prompt Injection Прямой эквивалент в ATT&CK отсутствует; ATLAS предоставляет наиболее точную ИИ-специфичную классификацию
Context Poisoning MITRE ATT&CK T1565: Data Manipulation; техники отравления данных в MITRE ATLAS Сопоставление зависит от того, какие именно данные подвергаются манипуляции: хранимые, передаваемые, запрашиваемые или данные времени выполнения
Кража и злоупотребление учетными данными MITRE ATT&CK T1528: Steal Application Access Token; T1552 может применяться при раскрытии секретов Применимая техника зависит от того, крадет ли нападающий токен приложения, ключ API, секрет сервисного аккаунта или другие учетные данные
Компрометация инструментов или цепочки поставок MITRE ATT&CK T1195: Supply Chain Compromise T1195 применяется при компрометации интеграции, зависимости или механизма доставки

Хотя точки входа различаются, операционный результат схож: злоумышленник перенаправляет доверенную автоматизацию или использует ее учетные данные вместо прямого взлома механизмов аутентификации.

Почему санкционированная активность ИИ-агента всё же может быть вредоносной

Существующие средства защиты остаются базовой необходимостью.

IAM определяет, какие учетные записи и права санкционированы. EDR обеспечивает телеметрию и защиту конечных точек. SIEM и облачный мониторинг коррелируют активность по всей системе. Ограничения (guardrails) моделей и политик могут регулировать входные данные, выводы и использование инструментов.

Однако ИИ-агент, подвергшийся манипуляции, может продолжать действовать строго в рамках этих разрешенных границ.

Он может использовать одобренные учетные данные, вызывать разрешенные API и выполнять действия, на которые у него технически есть права.

Сложность заключается в том, чтобы определить, служит ли последовательность корректных по отдельности действий бизнес-целям агента — или же задачам атакующего.

Поведенческая аналитика способна выявлять аномалии, однако активность ИИ-агента естественным образом варьируется в зависимости от задачи, контекста и используемых инструментов. Отдельный вызов API может не дать достаточных доказательств компрометации, а вредоносный характер многоэтапной цепочки может стать очевидным только после того, как значительная часть действий уже выполнена.

Иной подход к обнаружению

Технологии киберобмана решают эту проблему с другой стороны.

Вместо того чтобы спрашивать только:

«Выглядит ли эта активность необычно?»

специалисты по безопасности могут спросить:

«Почему эта учетная запись, агент или процесс взаимодействует с активом, который не требуется ни в одном санкционированном рабочем процессе?»

Когда ИИ-агент извлекает honeytoken, вызывает ложный инструмент или следует по пути HoneyPath к фальшивому API, это взаимодействие предоставляет высокоточные доказательства того, что агент вышел за пределы своего штатного операционного маршрута.

Таблица 3: Существующие средства защиты и слепая зона времени выполнения (Runtime)

Средство безопасности Что оно обеспечивает Что может оставаться нерешенным
IAM и управление идентификацией Определяет, какие учетные записи и права санкционированы Используется ли легитимный доступ по прямому назначению
Guardrails моделей и политик Соответствуют ли ввод, вывод и действия заданным правилам Что происходит после обхода правил, отравления контекста, компрометации инструмента или захвата учетных данных
Телеметрия EDR, SIEM, облака и API Фиксирует произошедшие события и контекст конечных точек, сети и приложений Доказывают ли легитимные по отдельности события факт злоупотребления полномочиями агента
Киберобман и 360 Deception Фиксирует факт взаимодействия агента или учетной записи с активом, не требующимся в штатной работе Точность обнаружения зависит от корректного размещения, покрытия, обслуживания и интеграции с SOC

Как выглядит поведение манипулируемого ИИ-агента на практике

Рассмотрим ИИ-агента клиентской поддержки, который обрабатывает загруженные документы перед извлечением информации из внутренних систем.

Злоумышленник внедряет скрытые инструкции внутрь загруженного PDF-файла. Когда агент обрабатывает документ, инструкции пытаются перенаправить его на извлечение конфиденциальных записей клиентов через внутренний API.

Запрос может увенчаться успехом, поскольку агент использует легитимные учетные данные с соответствующими правами.

Аутентификация уже успешно пройдена.

Теперь вопрос безопасности состоит в том, соответствует ли действие ИИ в режиме runtime его штатным задачам.

Выявление злоупотреблений после аутентификации

Другие средства защиты могут зафиксировать аномальный вызов API, нарушение политики или подозрительное перемещение данных.

Киберобман добавляет контролируемую возможность для генерации более четкого сигнала тревоги, когда агент:

  • взаимодействует с фальшивым API;
  • извлекает honeytoken, внедренный в доступные данные;
  • вызывает ложный или «медовый» навык (honey skill);
  • следует по пути HoneyPath, который ему не требуется;
  • пытается получить доступ к фальшивой учетной записи или ресурсу.

В этом сценарии цели атакующего изменили поведение агента, пока его учетная запись остается валидной.

Скомпрометированные учетные данные можно сменить. Но когда проблема заключается в скомпрометированном процессе принятия решений, защитникам также необходима видимость того, как доверенная учетная запись ведет себя после аутентификации.

Обнаружение и нейтрализация манипулируемых ИИ-агентов

Именно здесь подход 360 Deception от Acalvio органично встраивается в стратегию безопасности ИИ-агентов.

Этот подход делает ложные активы реалистичными, усложняет для нападающих классификацию реальных продуктивных ресурсов и формирует сигналы, которые автоматизированная разведка не может безопасно проигнорировать.

Вместе эти возможности создают среду, в которой у злоумышленников и манипулируемых ИИ-агентов остается всё меньше надежных данных для принятия решений о выборе следующей цели.

Deception Guardrails для агентного ИИ

В рамках платформы Acalvio ShadowPlex функционал Deception Guardrails распространяет концепцию 360 Deception на среды выполнения агентного ИИ.

Эта технология позволяет разворачивать фальшивые учетные записи, данные аутентификации, медовые навыки (honey skills), фальшивые серверы MCP, системы RAG, API и другие контролируемые активы по всему контуру рабочих процессов ИИ-агентов и поддерживающей их инфраструктуры.

Это дополняет guardrails моделей и политик, позволяя выявлять моменты, когда доверенный агент (или злоумышленник, использующий его учетную запись) выходит за пределы целевого операционного маршрута.

В этом и заключается роль киберобмана в превентивной стратегии кибербезопасности.

Цель состоит не в том, чтобы предсказать каждый возможный промпт, инструкцию или цепочку атак. Вместо этого технологии обмана оснащают датчиками вероятные пути злоупотреблений, создавая больше возможностей для проявления несанкционированного поведения на той скорости, с которой работают автономные агенты.

Киберобман в среде выполнения ИИ на практике

Honeytokens, размещенные в доступных агенту хранилищах учетных данных, файлах и конфигурационных поверхностях, позволяют выявлять несанкционированное извлечение учетных данных.

Медовые навыки (Honey skills) и ложные инструменты позволяют определить момент, когда агент вызывает функцию, не требующуюся ни в одном одобренном процессе.

Фальшивые серверы MCP, системы RAG и ИИ-агенты позволяют вскрывать попытки разведки, манипуляции или продвижения через смежную ИИ-инфраструктуру.

Ложные API, документы и объекты данных позволяют выявлять неожиданные обращения к приложениям, несанкционированный сбор или попытки выгрузки данных.

HoneyPaths выявляют горизонтальное перемещение, когда агент или нападающий передвигается по инфраструктуре за пределами разрешенного маршрута.

Внутри ShadowPlex управление этими ложными активами может осуществляться в динамических облачных и корпоративных средах. По мере изменения агентов, учетных записей, инструментов и рабочих нагрузок покрытие системами обмана адаптируется вместе с ними.

Автоматизация обеспечивает необходимый масштаб, тогда как операционная дисциплина гарантирует, что сигналы обмана остаются достоверными и пригодными для реагирования.

Киберобман дополняет существующие средства защиты ИИ

Киберобман не заменяет фильтрацию промптов, безопасность моделей, принцип наименьших привилегий, белые списки инструментов, IAM, EDR, облачную безопасность или процессы реагирования на инциденты.

Вместо этого он добавляет еще один уровень обнаружения, сфокусированный именно на несанкционированном взаимодействии со специально подготовленными ложными активами.

Его эффективность зависит от таких факторов, как:

  • точные места размещения ложных активов;
  • реалистичность контента обмана;
  • соответствующий охват вероятных путей атак;
  • четкое распределение ответственности и операционных процессов;
  • интеграция с рабочими процессами SOC;
  • постоянное обслуживание по мере изменения среды.

Базовый механизм обнаружения продемонстрировал измеримые результаты в борьбе с автоматизированными атаками, использующими учетные данные.

В ходе учений ВМС США по киберустойчивости (FY25 ANTX) технология Acalvio обеспечила 100% истинно положительных срабатываний и заблокировала порядка 80% целей атакующих в контролируемых тестовых условиях.

Хотя учения не являлись продуктивным развертыванием ИИ-агентов, они подтверждают более широкий тезис безопасности: ложные активы способны вскрывать и блокировать автоматизированную активность, опирающуюся на доверенные учетные данные.

Защита ИИ-агентов требует обнаружения в режиме Runtime

Внедрение промптов, отравление контекста, скомпрометированные инструменты и злоупотребление учетными данными являются постоянными рисками при использовании агентного ИИ.

Предотвращение остается важным этапом. Однако ни один фильтр ввода, политика доступа или поведенческая модель не способны предусмотреть каждый возможный путь в системе, которая непрерывно потребляет новую информацию и выполняет действия в динамических средах.

Цель состоит не в том, чтобы гарантировать встречу каждого вредоносного действия с ложным активом.

Задача организаций — оснастить датчиками пути атак, с наибольшей вероятностью вскрывающие злоупотребления, и превратить неоднозначную активность ИИ во время выполнения в доказательную базу, на основе которой команды безопасности могут принимать меры.

Устойчивая стратегия безопасности ИИ должна сочетать в себе:

  • безопасность учетных записей и принцип наименьших привилегий;
  • guardrails для моделей и политик;
  • мониторинг в режиме реального времени (runtime);
  • безопасность облачных сред и API;
  • процессы SOC и реагирования на инциденты;
  • обнаружение на основе технологий киберобмана.

Совместно эти средства контроля обеспечивают более раннюю видимость скомпрометированного поведения ИИ, сохраняя при этом инвестиции в IAM, EDR, SIEM, облачную безопасность и архитектуры Zero Trust.

Фундаментальный вопрос меняется.

Вместо того чтобы требовать от аналитиков угадывать намерения по слабым сигналам, организации могут создавать среду, где вредоносное взаимодействие генерирует четкие доказательства.

ИИ-агенты будут и дальше получать всё большую автономность и доступ к корпоративным системам. Организации не всегда могут исключить каждую технику манипуляции, но они способны сделать несанкционированное поведение видимым — и обнаружить его до того, как скомпрометированный агент превратит доверенный доступ в горизонтальное перемещение, повышение привилегий или утечку данных.

Укрепите стратегию безопасности ваших ИИ-агентов

Платформа Acalvio ShadowPlex с функционалом Deception Guardrails предоставляет превентивный уровень безопасности для сред агентного ИИ, используя технологии обмана для выявления скомпрометированных агентов, украденных учетных записей и несанкционированных взаимодействий.

Узнайте больше о том, как киберобман помогает защитить ИИ-агентов, а также учетные данные, инструменты, API, данные и инфраструктуру, на которые они опираются.