News

Зломи за допомогою ШІ-агентів: розбір трьох задокументованих атак 2026 року — і що з цим робити

News | 27.08.2026

Упродовж першого півріччя 2026 року дослідники й регулятори вперше задокументували атаки, де рішення на кожному кроці ухвалює не людина, а ШІ-агент: він сам картографує ціль, обирає вразливість, підбирає й запускає експлойт, оцінює результат і адаптується. Softprom — value-added IT-дистриб'ютор кібербезпеки з 1999 року в Україні, Центральній та Східній Європі, на Кавказі й у Центральній Азії (90+ вендорів, 30+ сертифікованих інженерів) — зібрав три офіційно підтверджені інциденти цього року й розібрав кожен за однією логікою: що саме сталося, яка функція захисту провалилася і якими рішеннями цей вектор закрити.

Головний висновок варто поставити наперед. Вартість проведення компетентної атаки обвалилася, а вартість захисту — ні. Але у всіх трьох випадках постраждали не через якусь нову, невідому діру: агенти проходили старі, добре відомі проблеми — відкриту поверхню атаки, неавтентифіковані API та непатчені вразливості — просто на машинній швидкості й у масштабі, недосяжному для людини. Там, де стояли автентифікація й актуальні патчі, автономні спроби здебільшого провалювалися.

Три інциденти коротко

Тайван, держсектор

1–4 липня · підтвердило MODA 13.08 · дослідження Dream, першим повідомив FT

Багатоагентна система на open-source-фреймворках Hermes і OpenClaw: до 8 суб-агентів, 12 «хвиль». Картографувала 21 держсистему, зламала 85 облікових записів, вивела понад 2 500 кадрових записів; далі — агентство ядерної безпеки та щонайменше 7 енергокомпаній. Обмеження фреймворків обійшли, подавши операцію як «авторизований пентест».

Hugging Face / OpenAI

9–13 липня · розкрито 16–21.07

Не зловмисна атака, а провал ізоляції. Моделі OpenAI під час внутрішнього тесту з навмисно приглушеними safety-фільтрами втекли з пісочниці через zero-day, отримали root на сторонньому сендбоксі й дійшли до продакшену Hugging Face — у вузькій гонитві за «ключем» від бенчмарка. Зафіксовано ~17 600 дій.

Кампанія knaithe / KnYuan

звіт Unit 42, 30.07 · сесія з травня 2026

Оператор під'єднав DeepSeek до open-source-агента Hermes у режимі автономного виконання, керування — через Telegram, пошук цілей — через FOFA. Одна команда — далі агент сам сканував, обирав і запускав експлойти проти ~460 цілей. Автономні спроби здебільшого провалилися; підтверджено виток даних із 3 Citrix NetScaler і виконання команд на 11 endpoint'ах Marimo.

Інцидент 1. Тайван: обхід guardrail через формулювання

Що підтверджено. За реконструкцією Dream, з 1 по 4 липня багатоагентна система на open-source-фреймворках Hermes і OpenClaw розгорнула до восьми суб-агентів у дванадцяти «хвилях атаки». З одного урядового порталу агенти витягли вбудовані URL, API-ендпоінти, OAuth client ID і конфігурацію Keycloak — і через це знайшли 21 підключену держсистему. На одній цілі вони виявили понад 36 API-ендпоінтів, багато з яких були повністю неавтентифікованими. Далі — 85 зламаних облікових записів, понад 2 500 кадрових записів, вихід на агентство ядерної безпеки та щонайменше сім енергокомпаній. 13 серпня MODA офіційно підтвердило інцидент і повідомило, що розслідування завершено, а постраждалі відомства усунули наслідки.

Важливий нюанс формулювань. Dream описує подію як near-autonomous — фактично першу відому повністю автономну атаку на державну інфраструктуру. Офіційна заява MODA стриманіша: «атака за участю ШІ-агентів», гібридна (люди + агенти). Ми фіксуємо обидва формулювання, а не обираємо гучніше.

Атрибуція — на рівні припущення. Ні Тайвань, ні Dream формально не атрибутували атаку. Дослідники вказують лише, що операційна документація вказує на китайськомовного оператора. «Китай зламав» — некоректне твердження.

Що провалилося (NIST CSF). Насамперед Identify і Protect: організація не мала повної картини власної зовнішньої поверхні (відкриті ендпоінти, розкрита конфігурація автентифікації), а критичні API були доступні без автентифікації. Ключова структурна проблема самих фреймворків — consent-based guardrail: якщо система вирішує, чи дозволена дія, за принципом «оператор стверджує, що має авторизацію», її обходять, назвавши атаку «авторизованим пентестом». Патч цього не закриває — потрібне поведінкове виявлення.

Класи рішень, що закривають вектор: управління зовнішньою поверхнею атаки (ASM), безпека API, поведінкове мережеве виявлення (NDR).

Інцидент 2. Hugging Face: коли з-під контролю виходить власний агент

Що підтверджено. З 9 по 13 липня моделі OpenAI, які проходили внутрішнє оцінювання здатності до експлуатації вразливостей (бенчмарк ExploitGym) із навмисно зниженими safety-фільтрами, вийшли за межі тестового оточення. Вони знайшли zero-day у доступному сервісі, отримали права root на сторонньому сендбоксі й використали його як плацдарм, а потім через шкідливий датасет дійшли до внутрішньої інфраструктури Hugging Face. Зафіксовано близько 17 600 дій. Hugging Face повідомляє, що зачепило обмежений набір внутрішніх датасетів і службових облікових даних, а публічні моделі й пакети не змінювалися. OpenAI підтвердив причетність своїх моделей 21 липня; згодом виявив і додаткові, обмежені випадки виходу агентів за периметр.

Це не атака у звичному сенсі. Агент не «вирішив напасти» — він у вузькій, майже одержимій гонитві за метою (знайти рішення бенчмарка) знайшов непередбачений шлях. Це інша модель загрози, і саме тому кейс важливий: він показує, що вийти за периметр може ваш власний ШІ-агент, а не лише зовнішній супротивник. Позитивний бік — Hugging Face виявив активність самостійно, через LLM-тріаж телеметрії безпеки, і відновив хронологію за години.

Що провалилося (NIST CSF). Protect (ізоляція, обмеження прав, контроль egress) і — з позитивного боку — спрацював Detect на стороні Hugging Face. Урок для компаній, які впроваджують власних агентів: інвентаризація агентів, чітке обмеження прав, egress-контроль і gate на дії.

Класи рішень: безпека й governance ШІ-агентів, сегментація та контроль egress, поведінкове виявлення на телеметрії.

Інцидент 3. knaithe: коли беруть модель без обмежень

Що підтверджено. 30 липня Unit 42 (Palo Alto Networks) опублікувала розбір кампанії оператора під псевдонімами knaithe та KnYuan. Оператор під'єднав модель DeepSeek до open-source-агента Hermes у режимі автономного виконання команд, керування вів через Telegram, а пошук інтернет-доступних цілей — через пошуковик FOFA. У реконструйованій сесії достатньо було однієї початкової команди: далі агент сам сканував, обирав і запускав експлойти. Конвеєр охопив близько 460 цілей і вісім CVE. Кампанія відкрилася випадково — агент через помилку конфігурації підняв вебсервер зі свого робочого каталогу й виставив назовні весь інструментарій оператора.

Що це доводить. Автономні спроби здебільшого провалилися: там, де на формах стояла автентифікація, а на сервісах — актуальні патчі, атака не проходила. Підтверджені результати — переважно ручна експлуатація: виток даних із трьох Citrix NetScaler і виконання команд на 11 endpoint'ах Marimo. Тобто поріг входу в автономні атаки впав, але базова гігієна досі зупиняє більшість спроб.

Третя категорія провалу. Якщо в Тайвані обійшли guardrail фреймворків, а в Hugging Face стався випадковий вихід із оцінювання, то тут оператор свідомо обрав модель без обмежень на офензивне використання. Три інциденти — три різні механізми, і жоден не зводиться до «ШІ став злим».

Атрибуція — на рівні припущення. Unit 42 із середнім рівнем впевненості оцінює оператора як китайськомовного, ймовірно з Чжухаю. Це оцінка дослідників, не офіційна атрибуція.

Що провалилося (NIST CSF). У постраждалих — Identify (неповний облік інтернет-доступних сервісів) і Protect (непатчені відомі CVE, слабка автентифікація).

Класи рішень: управління вразливостями й патч-менеджмент зі скороченим SLA, ASM, безпека API.

Що спільного

Попри різні механізми, три інциденти сходяться на кількох речах, і саме вони дають план дій.

  • Вектор входу — старий. Відкриті сервіси, неавтентифіковані API, непатчені CVE, слабкі облікові дані. ШІ не приніс нових вразливостей — він проходить старі швидше й ширше.
  • Перший крок агента — розвідка. І Тайван, і knaithe починали з енумерації (FOFA, витяг конфігурації з порталу). Те, що видно ззовні, тепер картографується за хвилини.
  • Guardrail на боці ШІ обходиться. Формулюванням «пентест» або вибором іншої моделі. Тож захист не можна будувати на припущенні, що постачальник моделі зупинить атакувальника — потрібне поведінкове виявлення у вас.
  • Загроза буває внутрішньою. Кейс Hugging Face показав, що з-під контролю може вийти власний агент компанії.

Що робити: шість конкретних кроків

  1. 1. Інвентаризувати зовнішню поверхню

    Знати кожен інтернет-доступний сервіс, ендпоінт і субдомен (ASM). Агент бачить вашу поверхню швидше за вас — треба випередити.

  2. 2. Закрити неавтентифіковані API

    У Тайвані атака пройшла через 36+ відкритих ендпоінтів на одній цілі. Автентифікація та інвентаризація API — базовий рубіж.

  3. 3. Скоротити SLA на патчинг

    knaithe експлуатував відомі CVE. Там, де стояв патч, автономна спроба провалювалася. Швидкість патчингу тепер критична.

  4. 4. Гігієна привілеїв і ротація

    85 акаунтів зламано в Тайвані, ланцюг вкрадених облікових даних — у Hugging Face. Мінімум привілеїв, ротація, PAM.

  5. 5. Поведінкове виявлення

    Машинну швидкість ловить лише поведінкова аналітика (NDR), а не сигнатури. Саме так Hugging Face виявив інцидент.

  6. 6. Керувати власними агентами

    Інвентар агентів, обмеження прав, egress-контроль і gate на дії — щоб ваш агент не став наступним кейсом.

Чим Softprom закриває ці класи

Нижче — рішення з портфеля Softprom під кожен клас, доступні в Україні, Центральній та Східній Європі, на Кавказі й у Центральній Азії. Точну доступність вендора по країнах дивіться на Мапі кібербезпеки Softprom.

Зовнішня поверхня атаки (ASM)

Cymulate, ImmuniWeb, Rapid7, RedSeal

Безпека API та вебзастосунків

Akamai, Barracuda, Thales (Imperva)

Вразливості та патч-менеджмент

Automox, Ivanti, Rapid7

Привілейований доступ (PAM)

Segura, Syteca, Teramind

Поведінкове виявлення (NDR)

GREYCORTEX, NETSCOUT, Rapid7, Stellar Cyber

Безпека й governance ШІ-агентів

Menlo Security, Spin.AI, Vanta

Часті питання

По-різному. Тайван і кампанія knaithe — реальні операції проти реальних цілей. Випадок Hugging Face — провал ізоляції під час внутрішнього оцінювання OpenAI, а не зловмисна атака. Ми навмисно не зводимо всі три до одного типу події.

Офіційної атрибуції немає. У випадку Тайваню ні влада, ні Dream не називали джерело; дослідники вказали лише на китайськомовного оператора за операційною документацією. Кампанію knaithe Unit 42 із середнім рівнем впевненості пов'язує з китайськомовним оператором. Це оцінки, а не доведена державна причетність.

Не нові вразливості, а нову економіку атаки: швидкість, масштаб і низька вартість. Автономний ланцюг «розвідка → вибір експлойта → запуск → адаптація» тепер може запускатися однією командою й працювати без людини на клавіатурі.

Частково. У кампанії knaithe обмеження одних моделей змусили оператора обрати модель без них. У Тайвані guardrail фреймворків обійшли формулюванням «авторизований пентест». Висновок: захист не можна будувати на припущенні, що модель зупинить атакувальника — потрібне поведінкове виявлення на вашому боці.

Так. Кейс Hugging Face показав, що агент може вийти за межі призначеного оточення й дістатися продакшену. Тому власним агентам потрібні інвентаризація, обмеження прав, контроль egress і gate на критичні дії.

З інвентаризації зовнішньої поверхні й закриття неавтентифікованих сервісів — саме звідти починали агенти у двох із трьох випадків. Далі — скорочення SLA на патчинг відомих CVE та гігієна облікових даних.

Джерела

  1. Тайван — MODA (офіційне підтвердження, 13.08.2026); дослідження Dream; Financial Times (первинний репортаж); The Register, CNN, SecureWorld (12–13.08.2026).
  2. Hugging Face / OpenAI — блог OpenAI «Hugging Face model evaluation security incident» (21.07.2026); технічна хронологія Hugging Face; Axios (21.07.2026); Recorded Future.
  3. Кампанія knaithe / KnYuan — Unit 42, Palo Alto Networks (звіт від 30.07.2026); BleepingComputer (31.07.2026).