News

Ризики безпеки AI-агентів: коли зловмисник перебирає на себе доступ агента

News | 28.08.2026

ШІ-агенти стрімко переходять зі статусу експериментальної технології до категорії корпоративних рішень. Вони здатні отримувати доступ до бізнес-додатків, запитувати бази даних, викликати API, виконувати робочі процеси, витягувати інформацію та приймати рішення від імені користувачів та організацій.

Це формує новий виклик у сфері кібербезпеки.

Коли ШІ-агенту надаються легітимні облікові дані, права доступу, API, інструменти та доступ до конфіденційної інформації, зловмиснику може навіть не знадобитися напряму компрометувати обліковий запис адміністратора. Якщо маніпуляції піддається сам агент, нападник потенційно може успадкувати той рівень доступу, який агенту вже офіційно довірено.

Наприкінці 2025 року компанія Anthropic розкрила дані про шпигунську кампанію GTG-1002, під час якої зловмисник маніпулював системою Claude Code для автономного виконання близько 80–90% тактичних операцій. Ця кампанія була пов'язана із ШІ-системою, координованою нападником, а не з компрометацією корпоративного ШІ-агента. Проте вона продемонструвала важливу можливість: ШІ-системи здатні пов'язувати в єдиний ланцюжок розвідку, експлуатацію, використання облікових даних, горизонтальне переміщення та збір даних на такій швидкості та в таких масштабах, які оператору-людині складно відтворити вручну.

Для підприємств, що впроваджують агентний ШІ (agentic AI), це кардинально змінює оцінку ризиків.

Автентифікація встановлює довіру. Поведінка ШІ під час виконання (runtime) визначає, чи не зловживають цією довірою.

Головне

  • ШІ-агенти працюють з реальними обліковими даними та правами доступу. Агент, що піддався маніпуляції, може використовувати цей доступ без генерації стандартних помилок автентифікації.
  • Зловмисники можуть підірвати довіру до агента за допомогою впровадження промптів (prompt injection), отруєння контексту, компрометації інструментів і залежностей або крадіжки облікових даних додатків.
  • IAM, EDR, SIEM, хмарна телеметрія та обмеження (guardrails) для ШІ залишаються необхідними, проте наявність валідних облікових даних та санкціонованих викликів API не доводить, що агент діє в межах своїх цільових завдань.
  • Кіберобман (Cyber deception) створює контрольовані можливості для генерації доказів шкідливої поведінки, коли агент звертається до honeytoken, слідує шляхом HoneyPath або взаємодіє з фальшивим активом.
  • Acalvio Deception Guardrails розширюють концепцію 360 Deception на середовища виконання агентного ШІ як функціональний модуль платформи ShadowPlex.

Як ШІ-агенти розширюють довірену поверхню атак

Корпоративні ШІ-агенти поєднують у собі три можливості, які традиційно існували окремо: ідентифікацію, автоматизацію та прийняття рішень.

Агент може проходити автентифікацію в корпоративних системах із використанням сервісного облікового запису або токенів API, витягувати інформацію з багатьох джерел та після цього автономно визначати, які дії необхідно зробити.

Це створює проблему безпеки, що виходить за межі традиційної безпеки моделей ШІ.

Чотири характеристики, що збільшують ризики безпеки ШІ

Привілейований обліковий запис. ШІ-агенти зазвичай використовують сервісні акаунти, токени OAuth, ключі API або інші машинні облікові записи. Їхні повноваження можуть охоплювати одразу кілька систем, тоді как деталізований контроль за окремими діями залишається нерівномірним.

Повноваження на виконання дій. На відміну від традиційного ПЗ, що виконує суворо задану послідовність операцій, ШІ-агенти можуть запускати скрипти, запитувати дані, змінювати записи, надсилати повідомлення, виділяти ресурси, викликати API та активувати додаткові робочі процеси.

Залежність від зовнішнього контексту та інструментів. Агентні процеси використовують промпти, дані RAG, документи, API, плагіни, сервери MCP та інструкції з інших систем або від інших агентів. Якщо довірене джерело інформації компрометується або отруюється, воно може змінити поведінку агента без зміни його облікових даних.

Високий обсяг активності у режимі реального часу (runtime). Для досягнення однієї мети агент може виконувати безліч дій із використанням різних інструментів. Кожна окрема дія може здаватися санкціонованою, навіть якщо вся послідовність у сукупності являє собою шкідливу активність.

Таким чином, питання безпеки виходить далеко за межі того, чи є безпечною модель ШІ сама по собі або чи є валідним обліковий запис. Фахівцям із захисту необхідно розуміти, де формується довіра, як її можна підірвати та в який момент шкідливе використання стає помітним.

Таблиця 1: Ланцюжок довіри ШІ-агента

Рівень довіри Чому довіряє підприємство Як можна підірвати довіру
Ідентифікація (Identity) Сервісні акаунти, токени OAuth, ключі API та машинні облікові записи Крадіжка облікових даних, надмірні права доступу або імперсонація облікового запису агента
Контекст (Context) Промпти, дані RAG, векторні бази даних, документи та бази знань Отруєння інструкцій або довірених даних з метою зміни рішень агента
Виконання (Execution) API, плагіни, зовнішні інструменти, робочі процеси та автоматизовані дії Компрометація інструменту або використання санкціонованої можливості у несанкціонованих цілях
Середовище виконання (Runtime) Послідовність рішень, викликів інструментів та дій у реальному часі Об'єднання коректних окремо кроків у ланцюжок горизонтального переміщення, підвищення привілеїв, несанкціонованого доступу або закріплення в системі

Чотири способи підриву довіри до ШІ-агента

Зловмисникам не обов'язково компрометувати саму модель ШІ. Вони можуть атакувати інформацію, облікові записи, інструменти та підтримуючу інфраструктуру, які впливають на роботу агента.

Впровадження промптів (Prompt Injection)

Атаки класу Prompt Injection впроваджують шкідливі інструкції в контент, що обробляється ШІ-агентом, такий як документи, електронні листи, веб-сторінки, тікети або інші зовнішні дані.

Замість експлуатації вразливостей ПЗ у традиційному розумінні нападник намагається вплинути на те, як агент інтерпретує інструкції та визначає подальші дії.

Отруєння контексту (Context Poisoning)

Context Poisoning націлений на інформацію, на яку агент спирається під час прийняття рішень.

Зловмисники можуть підміняти дані у векторних базах даних, контенті RAG, сховищах пам'яті, документах або інших довірених джерелах знань, щоб агент отримував неправдиву інформацію та виконував незаплановані дії.

Компрометація інструментів та ланцюжка постачання

Сучасні ШІ-агенти залежать від інструментів, плагінів, API, серверів MCP, бібліотек та сторонніх інтеграцій.

Компрометація одного з цих компонентів може впровадити шкідливу поведінку в початково довірений робочий процес. Оскільки агент уже має дозвіл на використання інструменту, шкідливі дії на перших порах можуть нагадувати легітимну активність.

Крадіжка облікових даних та зловживання ідентифікацією

Нападники можуть викрадати або несанкціоновано використовувати облікові дані додатків, ключі API, сервісні акаунти, токени OAuth та інші машинні ідентифікатори, пов'язані з ШІ-агентами.

У цьому сценарії зловмисник не обов'язково маніпулює самим агентом. Замість цього він використовує обліковий запис та повноваження, які агент уже має.

Ці вектори атак взаємопов'язані, але мають відмінності. Специфічні для ШІ маніпуляції найточніше відображені в матриці MITRE ATLAS, тоді як поведінка у корпоративній мережі, що виникає в результаті, може зіставлятися з MITRE ATT&CK.

Таблиця 2: Зіставлення атак на довіру ШІ-агентам із матрицями MITRE

Атака на довіру Відповідний фреймворк Важлива специфіка
Prompt Injection MITRE ATLAS: Prompt Injection Прямий еквівалент у ATT&CK відсутній; ATLAS надає найточнішу ШІ-специфічну класифікацію
Context Poisoning MITRE ATT&CK T1565: Data Manipulation; техніки отруєння даних у MITRE ATLAS Зіставлення залежить від того, які саме дані піддаються маніпуляції: збережені, передані, запитувані чи дані часу виконання
Крадіжка та зловживання обліковими даними MITRE ATT&CK T1528: Steal Application Access Token; T1552 може застосовуватися при розкритті секретів Застосовна техніка залежить від того, чи викрадає нападник токен додатка, ключ API, секрет сервісного акаунта чи інші облікові дані
Компрометація інструментів або ланцюжка постачання MITRE ATT&CK T1195: Supply Chain Compromise T1195 застосовується при компрометації інтеграції, залежності або механізму доставки

Хоча точки входу відрізняються, операційний результат схожий: зловмисник перенаправляє довірену автоматизацію або використовує її облікові дані замість прямого злому механізмів автентифікації.

Чому санкціонована активність ШІ-агента все ж може бути шкідливою

Існуючі засоби захисту залишаються базовою необхідністю.

IAM визначає, які облікові записи та права санкціоновані. EDR забезпечує телеметрію та захист кінцевих точок. SIEM та хмарний моніторинг корелюють активність по всій системі. Обмеження (guardrails) моделей та політик можуть регулювати вхідні дані, виводи та використання інструментів.

Однак ШІ-агент, що піддався маніпуляції, може продовжувати діяти суворо в межах цих дозволених меж.

Він може використовувати схвалені облікові дані, викликати дозволені API та виконувати дії, на які в нього технічно є права.

Складність полягає в тому, щоб визначити, чи слугує послідовність коректних окремо дій бізнес-цілям агента — чи завданням нападника.

Поведінкова аналітика здатна виявляти аномалії, проте активність ШІ-агента природним чином варіюється залежно від завдання, контексту та використовуваних інструментів. Окремий виклик API може не надати достатніх доказів компрометації, а шкідливий характер багатоетапного ланцюжка може стати очевидним лише після того, як значна частина дій вже виконана.

Інший підхід до виявлення

Технології кіберобману вирішують цю проблему з іншого боку.

Замість того щоб запитувати лише:

«Чи виглядає ця активність незвично?»

фахівці з безпеки можуть запитати:

«Чому цей обліковий запис, агент або процес взаємодіє з активом, який не потрібен у жодному санкціонованому робочому процесі?»

Коли ШІ-агент витягує honeytoken, викликає фальшивий інструмент або слідує шляхом HoneyPath до фальшивого API, ця взаємодія надає високоточні докази того, що агент вийшов за межі свого штатного операційного маршруту.

Таблиця 3: Існуючі засоби захисту та сліпа зона часу виконання (Runtime)

Засіб безпеки Що він забезпечує Що може залишатися невирішеним
IAM та управління ідентифікацією Визначає, які облікові записи та права є санкціонованими Чи використовується легітимний доступ за прямим призначенням
Guardrails моделей та політик Чи відповідають ввід, вивід та дії заданим правилам Що відбувається після обходу правил, отруєння контексту, компрометації інструменту або захоплення облікових даних
Телеметрія EDR, SIEM, хмари та API Фіксує події, що відбулися, та контекст кінцевих точок, мережі й додатків Чи доводять легітимні окремо події факт зловживання повноваженнями агента
Кіберобман та 360 Deception Фіксує факт взаємодії агента або облікового запису з активом, що не потрібен у штатній роботі Точність виявлення залежить від коректного розміщення, покриття, обслуговування та інтеграції з SOC

Як виглядає поведінка маніпульованого ШІ-агента на практиці

Розглянемо ШІ-агента клієнтської підтримки, який обробляє завантажені документи перед витягуванням інформації з внутрішніх систем.

Зловмисник впроваджує приховані інструкції всередину завантаженого PDF-файлу. Коли агент обробляє документ, інструкції намагаються перенаправити його на витягування конфіденційних записів клієнтів через внутрішній API.

Запит може завершитися успішно, оскільки агент використовує легітимні облікові дані з відповідними правами.

Автентифікація вже успішно пройдена.

Тепер питання безпеки полягає в тому, чи відповідає дія ШІ у режимі runtime його штатним завданням.

Виявлення зловживань після автентифікації

Інші засоби захисту можуть зафіксувати аномальний виклик API, порушення політики або підозріле переміщення даних.

Кіберобман додає контрольовану можливість для генерації чіткішого сигналу тривоги, коли агент:

  • взаємодіє з фальшивим API;
  • витягує honeytoken, впроваджений у доступні дані;
  • викликає фальшивий або «медовий» навичка (honey skill);
  • слідує шляхом HoneyPath, який йому не потрібен;
  • намагається отримати доступ до фальшивого облікового запису або ресурсу.

У цьому сценарії цілі нападника змінили поведінку агента, поки його обліковий запис залишається валідним.

Скомпрометовані облікові дані можна змінити. Але коли проблема полягає у скомпрометованому процесі прийняття рішень, фахівцям із захисту також необхідна видимість того, як довірений обліковий запис поводиться після автентифікації.

Виявлення та нейтралізація маніпульованих ШІ-агентів

Саме тут підхід 360 Deception від Acalvio органічно вбудовується в стратегію безпеки ШІ-агентів.

Цей підхід робить фальшиві активи реалістичними, ускладнює для нападників класифікацію реальних продуктивних ресурсів та формує сигнали, які автоматизована розвідка не може безпечно проігнорувати.

Разом ці можливості створюють середовище, у якому у зловмисників та маніпульованих ШІ-агентів залишається все менше надійних даних для прийняття рішень про вибір наступної цілі.

Deception Guardrails для агентного ШІ

У межах платформи Acalvio ShadowPlex функціонал Deception Guardrails поширює концепцію 360 Deception на середовища виконання агентного ШІ.

Ця технологія дозволяє розгортати фальшиві облікові записи, дані автентифікації, медові навички (honey skills), фальшиві сервери MCP, системи RAG, API та інші контрольовані активи по всьому контуру робочих процесів ШІ-агентів та інфраструктури, що їх підтримує.

Це доповнює guardrails моделей та политик, дозволяючи виявляти моменти, коли довірений агент (або зловмисник, що використовує його обліковий запис) виходить за межі цільового операційного маршруту.

У цьому й полягає роль кіберобману в превентивній стратегії кібербезпеки.

Мета полягає не в тому, щоб передбачити кожен можливий промпт, інструкцію або ланцюжок атак. Замість цього технології обману оснащують датчиками ймовірні шляхи зловживань, створюючи більше можливостей для прояву несанкціонованої поведінки на тій швидкості, з якою працюють автономні агенти.

Кіберобман у середовищі виконання ШІ на практиці

Honeytokens, розміщені в доступних агенту сховищах облікових даних, файлах та конфігураційних поверхнях, дозволяють виявляти несанкціоноване витягування облікових даних.

Медові навички (Honey skills) та фальшиві інструменти дозволяють визначити момент, коли агент викликає функцію, що не потрібна в жодному схваленому процесі.

Фальшиві сервери MCP, системи RAG та ШІ-агенти дозволяють викривати спроби розвідки, маніпуляції або просування через суміжну ШІ-інфраструктуру.

Фальшиві API, документи та об'єкти даних дозволяють виявляти несподівані звернення до додатків, несанкціонований збір або спроби вивантаження даних.

HoneyPaths виявляють горизонтальне переміщення, коли агент або нападник пересувається інфраструктурою за межами дозволеного маршруту.

Усередині ShadowPlex управління цими фальшивими активами може здійснюватися в динамічних хмарних та корпоративних середовищах. У міру зміни агентів, облікових записів, інструментів та робочих навантажень покриття системами обману адаптується разом із ними.

Автоматизація забезпечує необхідний масштаб, тоді як операційна дисципліна гарантує, що сигнали обману залишаються достовірними та придатними для реагування.

Кіберобман доповнює існуючі засоби захисту ШІ

Кіберобман не замінює фільтрацію промптів, безпеку моделей, принцип найменших привілеїв, білі списки інструментів, IAM, EDR, хмарну безпеку або процеси реагування на інциденти.

Замість цього він додає ще один рівень виявлення, сфокусований саме на несанкціонованій взаємодії зі спеціально підготовленими фальшивими активами.

Його ефективність залежить від таких факторів, як:

  • точні місця розміщення фальшивих активів;
  • реалістичність контенту обману;
  • відповідне охоплення ймовірних шляхів атак;
  • чіткий розподіл відповідальності та операційних процесів;
  • інтеграція з робочими процесами SOC;
  • постійне обслуговування в міру зміни середовища.

Базовий механізм виявлення продемонстрував вимірні результати у боротьбі з автоматизованими атаками, що використовують облікові дані.

Під час навчань ВМС США з кіберстійкості (FY25 ANTX) технологія Acalvio забезпечила 100% істинно позитивних спрацьовувань та заблокувала близько 80% цілей нападників у контрольованих тестових умовах.

Хоча навчання не були продуктивним розгортанням ШІ-агентів, вони підтверджують ширшу тезу безпеки: фальшиві активи здатні викривати та блокувати автоматизовану активність, яка спирається на довірені облікові дані.

Захист ШІ-агентів вимагає виявлення в режимі Runtime

Впровадження промптів, отруєння контексту, скомпрометовані інструменти та зловживання обліковими даними є постійними ризиками при використанні агентного ШІ.

Запобігання залишається важливим етапом. Однак жоден фільтр вводу, політика доступу або поведінкова модель не здатні передбачити кожен можливий шлях у системі, яка безперервно споживає нову інформацію та виконує дії в динамічних середовищах.

Мета полягає не в тому, щоб гарантувати зустріч кожної шкідливої дії з фальшивим активом.

Завдання організацій — оснастити датчиками шляхи атак, які з найбільшою ймовірністю викривають зловживання, та перетворити неоднозначну активність ШІ під час виконання на доказову базу, на основі якої команди безпеки можуть вживати заходів.

Стійка стратегія безпеки ШІ має поєднувати в собі:

  • безпеку облікових записів та принцип найменших привілеїв;
  • guardrails для моделей та политик;
  • моніторинг у режимі реального часу (runtime);
  • безпеку хмарних середовищ та API;
  • процеси SOC та реагування на інциденти;
  • виявлення на основі технологій кіберобману.

Спільно ці засоби контролю забезпечують ранішу видимість скомпрометованої поведінки ШІ, зберігаючи при цьому інвестиції в IAM, EDR, SIEM, хмарну безпеку та архітектури Zero Trust.

Фундаментальне питання змінюється.

Замість того щоб вимагати від аналітиків здогадуватися про наміри за слабкими сигналами, організації можуть створювати середовище, де шкідлива взаємодія генерує чіткі докази.

ШІ-агенти й надалі отримуватимуть все більшу автономність та доступ до корпоративних систем. Організації не завжди можуть виключити кожну техніку маніпуляції, але вони здатні зробити несанкціоновану поведінку видимою — та виявити її до того, як скомпрометований агент перетворить довірений доступ на горизонтальне переміщення, підвищення привілеїв або витік даних.

Посильте стратегію безпеки ваших ШІ-агентів

Платформа Acalvio ShadowPlex з функціоналом Deception Guardrails надає превентивний рівень безпеки для середовищ агентного ШІ, використовуючи технології обману для виявлення скомпрометованих агентів, украдених облікових записів та несанкціонованих взаємодій.

Дізнайтеся більше про те, як кіберобман допомагає захистити ШІ-агентів, а також облікові дані, інструменти, API, дані та інфраструктуру, на які вони спираються.