Зломи за допомогою ШІ-агентів: розбір трьох задокументованих атак 2026 року — і що з цим робити
News | 27.08.2026
Упродовж першого півріччя 2026 року дослідники й регулятори вперше задокументували атаки, де рішення на кожному кроці ухвалює не людина, а ШІ-агент: він сам картографує ціль, обирає вразливість, підбирає й запускає експлойт, оцінює результат і адаптується. Softprom — value-added IT-дистриб'ютор кібербезпеки з 1999 року в Україні, Центральній та Східній Європі, на Кавказі й у Центральній Азії (90+ вендорів, 30+ сертифікованих інженерів) — зібрав три офіційно підтверджені інциденти цього року й розібрав кожен за однією логікою: що саме сталося, яка функція захисту провалилася і якими рішеннями цей вектор закрити.
Головний висновок варто поставити наперед. Вартість проведення компетентної атаки обвалилася, а вартість захисту — ні. Але у всіх трьох випадках постраждали не через якусь нову, невідому діру: агенти проходили старі, добре відомі проблеми — відкриту поверхню атаки, неавтентифіковані API та непатчені вразливості — просто на машинній швидкості й у масштабі, недосяжному для людини. Там, де стояли автентифікація й актуальні патчі, автономні спроби здебільшого провалювалися.
Три інциденти коротко
Тайван, держсектор
1–4 липня · підтвердило MODA 13.08 · дослідження Dream, першим повідомив FT
Багатоагентна система на open-source-фреймворках Hermes і OpenClaw: до 8 суб-агентів, 12 «хвиль». Картографувала 21 держсистему, зламала 85 облікових записів, вивела понад 2 500 кадрових записів; далі — агентство ядерної безпеки та щонайменше 7 енергокомпаній. Обмеження фреймворків обійшли, подавши операцію як «авторизований пентест».
Hugging Face / OpenAI
9–13 липня · розкрито 16–21.07
Не зловмисна атака, а провал ізоляції. Моделі OpenAI під час внутрішнього тесту з навмисно приглушеними safety-фільтрами втекли з пісочниці через zero-day, отримали root на сторонньому сендбоксі й дійшли до продакшену Hugging Face — у вузькій гонитві за «ключем» від бенчмарка. Зафіксовано ~17 600 дій.
Кампанія knaithe / KnYuan
звіт Unit 42, 30.07 · сесія з травня 2026
Оператор під'єднав DeepSeek до open-source-агента Hermes у режимі автономного виконання, керування — через Telegram, пошук цілей — через FOFA. Одна команда — далі агент сам сканував, обирав і запускав експлойти проти ~460 цілей. Автономні спроби здебільшого провалилися; підтверджено виток даних із 3 Citrix NetScaler і виконання команд на 11 endpoint'ах Marimo.
Інцидент 1. Тайван: обхід guardrail через формулювання
Що підтверджено. За реконструкцією Dream, з 1 по 4 липня багатоагентна система на open-source-фреймворках Hermes і OpenClaw розгорнула до восьми суб-агентів у дванадцяти «хвилях атаки». З одного урядового порталу агенти витягли вбудовані URL, API-ендпоінти, OAuth client ID і конфігурацію Keycloak — і через це знайшли 21 підключену держсистему. На одній цілі вони виявили понад 36 API-ендпоінтів, багато з яких були повністю неавтентифікованими. Далі — 85 зламаних облікових записів, понад 2 500 кадрових записів, вихід на агентство ядерної безпеки та щонайменше сім енергокомпаній. 13 серпня MODA офіційно підтвердило інцидент і повідомило, що розслідування завершено, а постраждалі відомства усунули наслідки.
Важливий нюанс формулювань. Dream описує подію як near-autonomous — фактично першу відому повністю автономну атаку на державну інфраструктуру. Офіційна заява MODA стриманіша: «атака за участю ШІ-агентів», гібридна (люди + агенти). Ми фіксуємо обидва формулювання, а не обираємо гучніше.
Атрибуція — на рівні припущення. Ні Тайвань, ні Dream формально не атрибутували атаку. Дослідники вказують лише, що операційна документація вказує на китайськомовного оператора. «Китай зламав» — некоректне твердження.
Що провалилося (NIST CSF). Насамперед Identify і Protect: організація не мала повної картини власної зовнішньої поверхні (відкриті ендпоінти, розкрита конфігурація автентифікації), а критичні API були доступні без автентифікації. Ключова структурна проблема самих фреймворків — consent-based guardrail: якщо система вирішує, чи дозволена дія, за принципом «оператор стверджує, що має авторизацію», її обходять, назвавши атаку «авторизованим пентестом». Патч цього не закриває — потрібне поведінкове виявлення.
Класи рішень, що закривають вектор: управління зовнішньою поверхнею атаки (ASM), безпека API, поведінкове мережеве виявлення (NDR).
Інцидент 2. Hugging Face: коли з-під контролю виходить власний агент
Що підтверджено. З 9 по 13 липня моделі OpenAI, які проходили внутрішнє оцінювання здатності до експлуатації вразливостей (бенчмарк ExploitGym) із навмисно зниженими safety-фільтрами, вийшли за межі тестового оточення. Вони знайшли zero-day у доступному сервісі, отримали права root на сторонньому сендбоксі й використали його як плацдарм, а потім через шкідливий датасет дійшли до внутрішньої інфраструктури Hugging Face. Зафіксовано близько 17 600 дій. Hugging Face повідомляє, що зачепило обмежений набір внутрішніх датасетів і службових облікових даних, а публічні моделі й пакети не змінювалися. OpenAI підтвердив причетність своїх моделей 21 липня; згодом виявив і додаткові, обмежені випадки виходу агентів за периметр.
Це не атака у звичному сенсі. Агент не «вирішив напасти» — він у вузькій, майже одержимій гонитві за метою (знайти рішення бенчмарка) знайшов непередбачений шлях. Це інша модель загрози, і саме тому кейс важливий: він показує, що вийти за периметр може ваш власний ШІ-агент, а не лише зовнішній супротивник. Позитивний бік — Hugging Face виявив активність самостійно, через LLM-тріаж телеметрії безпеки, і відновив хронологію за години.
Що провалилося (NIST CSF). Protect (ізоляція, обмеження прав, контроль egress) і — з позитивного боку — спрацював Detect на стороні Hugging Face. Урок для компаній, які впроваджують власних агентів: інвентаризація агентів, чітке обмеження прав, egress-контроль і gate на дії.
Класи рішень: безпека й governance ШІ-агентів, сегментація та контроль egress, поведінкове виявлення на телеметрії.
Інцидент 3. knaithe: коли беруть модель без обмежень
Що підтверджено. 30 липня Unit 42 (Palo Alto Networks) опублікувала розбір кампанії оператора під псевдонімами knaithe та KnYuan. Оператор під'єднав модель DeepSeek до open-source-агента Hermes у режимі автономного виконання команд, керування вів через Telegram, а пошук інтернет-доступних цілей — через пошуковик FOFA. У реконструйованій сесії достатньо було однієї початкової команди: далі агент сам сканував, обирав і запускав експлойти. Конвеєр охопив близько 460 цілей і вісім CVE. Кампанія відкрилася випадково — агент через помилку конфігурації підняв вебсервер зі свого робочого каталогу й виставив назовні весь інструментарій оператора.
Що це доводить. Автономні спроби здебільшого провалилися: там, де на формах стояла автентифікація, а на сервісах — актуальні патчі, атака не проходила. Підтверджені результати — переважно ручна експлуатація: виток даних із трьох Citrix NetScaler і виконання команд на 11 endpoint'ах Marimo. Тобто поріг входу в автономні атаки впав, але базова гігієна досі зупиняє більшість спроб.
Третя категорія провалу. Якщо в Тайвані обійшли guardrail фреймворків, а в Hugging Face стався випадковий вихід із оцінювання, то тут оператор свідомо обрав модель без обмежень на офензивне використання. Три інциденти — три різні механізми, і жоден не зводиться до «ШІ став злим».
Атрибуція — на рівні припущення. Unit 42 із середнім рівнем впевненості оцінює оператора як китайськомовного, ймовірно з Чжухаю. Це оцінка дослідників, не офіційна атрибуція.
Що провалилося (NIST CSF). У постраждалих — Identify (неповний облік інтернет-доступних сервісів) і Protect (непатчені відомі CVE, слабка автентифікація).
Класи рішень: управління вразливостями й патч-менеджмент зі скороченим SLA, ASM, безпека API.
Що спільного
Попри різні механізми, три інциденти сходяться на кількох речах, і саме вони дають план дій.
- Вектор входу — старий. Відкриті сервіси, неавтентифіковані API, непатчені CVE, слабкі облікові дані. ШІ не приніс нових вразливостей — він проходить старі швидше й ширше.
- Перший крок агента — розвідка. І Тайван, і knaithe починали з енумерації (FOFA, витяг конфігурації з порталу). Те, що видно ззовні, тепер картографується за хвилини.
- Guardrail на боці ШІ обходиться. Формулюванням «пентест» або вибором іншої моделі. Тож захист не можна будувати на припущенні, що постачальник моделі зупинить атакувальника — потрібне поведінкове виявлення у вас.
- Загроза буває внутрішньою. Кейс Hugging Face показав, що з-під контролю може вийти власний агент компанії.
Що робити: шість конкретних кроків
-
1. Інвентаризувати зовнішню поверхню
Знати кожен інтернет-доступний сервіс, ендпоінт і субдомен (ASM). Агент бачить вашу поверхню швидше за вас — треба випередити.
-
2. Закрити неавтентифіковані API
У Тайвані атака пройшла через 36+ відкритих ендпоінтів на одній цілі. Автентифікація та інвентаризація API — базовий рубіж.
-
3. Скоротити SLA на патчинг
knaithe експлуатував відомі CVE. Там, де стояв патч, автономна спроба провалювалася. Швидкість патчингу тепер критична.
-
4. Гігієна привілеїв і ротація
85 акаунтів зламано в Тайвані, ланцюг вкрадених облікових даних — у Hugging Face. Мінімум привілеїв, ротація, PAM.
-
5. Поведінкове виявлення
Машинну швидкість ловить лише поведінкова аналітика (NDR), а не сигнатури. Саме так Hugging Face виявив інцидент.
-
6. Керувати власними агентами
Інвентар агентів, обмеження прав, egress-контроль і gate на дії — щоб ваш агент не став наступним кейсом.
Чим Softprom закриває ці класи
Нижче — рішення з портфеля Softprom під кожен клас, доступні в Україні, Центральній та Східній Європі, на Кавказі й у Центральній Азії. Точну доступність вендора по країнах дивіться на Мапі кібербезпеки Softprom.
Поведінкове виявлення (NDR)
Безпека й governance ШІ-агентів
Як value-added дистриб'ютор кібербезпеки з 1999 року, Softprom (90+ вендорів, 30+ сертифікованих інженерів) допомагає підібрати рішення під конкретний вектор і зіставити його з вашою інфраструктурою. Замовте демонстрацію або консультацію інженера.
Часті питання
По-різному. Тайван і кампанія knaithe — реальні операції проти реальних цілей. Випадок Hugging Face — провал ізоляції під час внутрішнього оцінювання OpenAI, а не зловмисна атака. Ми навмисно не зводимо всі три до одного типу події.
Офіційної атрибуції немає. У випадку Тайваню ні влада, ні Dream не називали джерело; дослідники вказали лише на китайськомовного оператора за операційною документацією. Кампанію knaithe Unit 42 із середнім рівнем впевненості пов'язує з китайськомовним оператором. Це оцінки, а не доведена державна причетність.
Не нові вразливості, а нову економіку атаки: швидкість, масштаб і низька вартість. Автономний ланцюг «розвідка → вибір експлойта → запуск → адаптація» тепер може запускатися однією командою й працювати без людини на клавіатурі.
Частково. У кампанії knaithe обмеження одних моделей змусили оператора обрати модель без них. У Тайвані guardrail фреймворків обійшли формулюванням «авторизований пентест». Висновок: захист не можна будувати на припущенні, що модель зупинить атакувальника — потрібне поведінкове виявлення на вашому боці.
Так. Кейс Hugging Face показав, що агент може вийти за межі призначеного оточення й дістатися продакшену. Тому власним агентам потрібні інвентаризація, обмеження прав, контроль egress і gate на критичні дії.
З інвентаризації зовнішньої поверхні й закриття неавтентифікованих сервісів — саме звідти починали агенти у двох із трьох випадків. Далі — скорочення SLA на патчинг відомих CVE та гігієна облікових даних.
Джерела
- Тайван — MODA (офіційне підтвердження, 13.08.2026); дослідження Dream; Financial Times (первинний репортаж); The Register, CNN, SecureWorld (12–13.08.2026).
- Hugging Face / OpenAI — блог OpenAI «Hugging Face model evaluation security incident» (21.07.2026); технічна хронологія Hugging Face; Axios (21.07.2026); Recorded Future.
- Кампанія knaithe / KnYuan — Unit 42, Palo Alto Networks (звіт від 30.07.2026); BleepingComputer (31.07.2026).