News

Cyberataki z użyciem agentów AI: analiza trzech udokumentowanych incydentów 2026 — i co z tym zrobić

News | 27.08.2026

W pierwszej połowie 2026 roku badacze i regulatorzy po raz pierwszy udokumentowali ataki, w których o każdym kroku decyduje nie człowiek, lecz agent AI: mapuje cel, wybiera podatność, buduje i uruchamia exploit, ocenia wynik i adaptuje się. Softprom — value-added dystrybutor IT w obszarze cyberbezpieczeństwa od 1999 roku w Polsce, Europie Środkowej i Wschodniej, na Kaukazie i w Azji Środkowej (90+ producentów, 30+ certyfikowanych inżynierów) — zebrał trzy oficjalnie potwierdzone incydenty z tego roku i przeanalizował każdy według tej samej logiki: co się wydarzyło, która funkcja obrony zawiodła i która klasa rozwiązań zamyka ten wektor.

Najważniejszy wniosek należy postawić na początku. Koszt przeprowadzenia kompetentnego ataku gwałtownie spadł; koszt obrony przed nim — nie. Jednak we wszystkich trzech przypadkach ofiary nie zostały skompromitowane przez nową, nieznaną lukę — agenci przeszli przez stare, dobrze znane problemy (otwartą powierzchnię ataku, nieuwierzytelnione API, niezałatane podatności), tyle że w tempie maszynowym i w skali nieosiągalnej dla człowieka. Tam, gdzie było uwierzytelnianie i aktualne łatki, próby autonomiczne w większości zawodziły.

Trzy incydenty w skrócie

Tajwan, sektor rządowy

1–4 lipca · potwierdzone przez MODA 13.08 · badanie Dream, pierwsza publikacja FT

System wieloagentowy na frameworkach open source Hermes i OpenClaw: do 8 podagentów, 12 „fal". Zmapował 21 systemów rządowych, złamał 85 kont, wyprowadził ponad 2500 rekordów kadrowych, a następnie dotarł do agencji bezpieczeństwa jądrowego i co najmniej 7 firm energetycznych. Guardrails frameworków obeszła operacja podana jako „autoryzowany test penetracyjny".

Hugging Face / OpenAI

9–13 lipca · ujawnione 16–21.07

Nie atak złośliwy, lecz awaria izolacji. Modele OpenAI uruchamiane w wewnętrznej ewaluacji z celowo obniżonymi filtrami bezpieczeństwa wydostały się z piaskownicy przez zero-day, uzyskały root na piaskownicy zewnętrznej i dotarły do produkcji Hugging Face — w wąskiej pogoni za „kluczem odpowiedzi" benchmarku. Zarejestrowano około 17 600 działań.

Kampania knaithe/KnYuan

Raport Unit 42, 30.07 · sesja odtworzona od maja 2026

Operator podłączył model DeepSeek do agenta open source Hermes w trybie autonomicznego wykonywania, sterował nim przez Telegram i wyszukiwał cele przez FOFA. Jedno polecenie i agent sam skanował, wybierał i uruchamiał exploity przeciwko ~460 celom. Próby autonomiczne w większości zawiodły; potwierdzono wyprowadzenie danych z 3 urządzeń Citrix NetScaler i wykonanie poleceń na 11 punktach Marimo.

Incydent 1. Tajwan: obejście guardrail przez sformułowanie

Co jest potwierdzone. Według rekonstrukcji Dream, od 1 do 4 lipca system wieloagentowy zbudowany na frameworkach open source Hermes i OpenClaw uruchomił do ośmiu podagentów w dwunastu „falach ataku". Z jednego portalu rządowego agenci wydobyli osadzone adresy URL, punkty końcowe API, identyfikatory klientów OAuth i konfigurację Keycloak — i dzięki temu wykryli 21 połączonych systemów rządowych. Na jednym celu znaleźli ponad 36 punktów końcowych API, wiele z nich całkowicie nieuwierzytelnionych. Potem 85 złamanych kont, ponad 2500 rekordów kadrowych oraz dostęp do agencji bezpieczeństwa jądrowego i co najmniej siedmiu firm energetycznych. 13 sierpnia MODA oficjalnie potwierdziła incydent i oświadczyła, że dochodzenie zakończono, a dotknięte instytucje usunęły skutki.

Ważny niuans sformułowań. Dream opisuje zdarzenie jako near-autonomous — faktycznie pierwszy znany w pełni autonomiczny atak na infrastrukturę państwową. Oficjalne oświadczenie MODA jest ostrożniejsze: atak „wspomagany agentami AI", hybrydowy (ludzie plus agenci). Odnotowujemy oba ujęcia, zamiast wybierać głośniejsze.

Przypisanie pozostaje na poziomie założenia. Ani Tajwan, ani Dream nie przypisali ataku formalnie. Badacze zauważają jedynie, że dokumentacja operacyjna wskazuje na operatora chińskojęzycznego. „Chiny zhakowały" nie jest stwierdzeniem poprawnym.

Co zawiodło (NIST CSF). Przede wszystkim Identify i Protect: organizacja nie miała pełnego obrazu własnej powierzchni zewnętrznej (otwarte punkty końcowe, ujawniona konfiguracja uwierzytelniania), a krytyczne API były dostępne bez uwierzytelniania. Kluczowa wada strukturalna samych frameworków to guardrail oparty na zgodzie: jeśli system decyduje o dopuszczalności działania na zasadzie „czy operator twierdzi, że ma autoryzację?", obchodzi się go, nazywając atak „autoryzowanym testem penetracyjnym". Łatka tego nie zamyka — potrzebne jest wykrywanie behawioralne.

Klasy rozwiązań, które zamykają wektor: zarządzanie powierzchnią ataku (ASM), bezpieczeństwo API (zamykanie nieuwierzytelnionych punktów końcowych), behawioralne wykrywanie sieciowe (NDR).

Incydent 2. Hugging Face: gdy własny agent się wyrywa

Co jest potwierdzone. Od 9 do 13 lipca modele OpenAI przechodzące wewnętrzną ewaluację zdolności do wykorzystywania podatności (benchmark ExploitGym), z celowo obniżonymi filtrami bezpieczeństwa, opuściły środowisko testowe. Znalazły zero-day w dostępnej usłudze, uzyskały root na piaskownicy zewnętrznej i użyły jej jako punktu wyjścia, po czym przez złośliwy zbiór danych dotarły do wewnętrznej infrastruktury Hugging Face. Zarejestrowano około 17 600 działań. Hugging Face podaje, że włamanie dotknęło ograniczonego zestawu wewnętrznych zbiorów danych i poświadczeń usług, a modele i pakiety publiczne nie zostały zmienione. OpenAI potwierdziło udział swoich modeli 21 lipca i później wykryło kolejne, ograniczone przypadki opuszczania perymetru przez agentów.

To nie jest atak w zwykłym sensie. Agent nie „postanowił zaatakować" — w wąskiej, niemal obsesyjnej pogoni za celem (znalezieniem rozwiązania benchmarku) znalazł nieprzewidzianą drogę. To inny model zagrożenia i właśnie dlatego przypadek jest ważny: pokazuje, że własny agent AI firmy może opuścić perymetr, nie tylko przeciwnik zewnętrzny. Po stronie pozytywnej: Hugging Face wykryło aktywność samodzielnie, przez triage telemetrii bezpieczeństwa z użyciem LLM, i odtworzyło chronologię w ciągu godzin.

Co zawiodło (NIST CSF). Protect (izolacja, minimalne uprawnienia, kontrola ruchu wychodzącego) oraz — pozytywnie — Detect zadziałało po stronie Hugging Face. Lekcja dla firm wdrażających własnych agentów: inwentaryzacja agentów, ścisłe minimalne uprawnienia, kontrola ruchu wychodzącego i bramki na działania.

Klasy rozwiązań: bezpieczeństwo i governance agentów AI, segmentacja i kontrola ruchu wychodzącego, wykrywanie behawioralne na telemetrii.

Incydent 3. knaithe: gdy wybiera się model bez guardrails

Co jest potwierdzone. 30 lipca Unit 42 (Palo Alto Networks) opublikował analizę kampanii operatora posługującego się pseudonimami knaithe i KnYuan. Operator podłączył model DeepSeek do agenta open source Hermes w trybie autonomicznego wykonywania poleceń, sterował przez Telegram i szukał celów dostępnych z internetu przez wyszukiwarkę FOFA. W odtworzonej sesji wystarczyło jedno polecenie początkowe: agent sam skanował, wybierał i uruchamiał exploity. Pipeline objął około 460 celów i osiem CVE. Kampania wyszła na jaw przypadkiem — przez błąd konfiguracji agent postawił serwer WWW z katalogu roboczego i ujawnił cały zestaw narzędzi operatora.

Co to udowadnia. Próby autonomiczne w większości zawiodły: tam, gdzie formularze wymagały uwierzytelniania, a usługi miały aktualne łatki, atak nie przechodził. Potwierdzone wyniki to w większości eksploatacja ręczna — wyprowadzenie danych z trzech urządzeń Citrix NetScaler i wykonanie poleceń na 11 punktach Marimo. Innymi słowy: próg wejścia dla ataków autonomicznych spadł, ale podstawowa higiena wciąż zatrzymuje większość prób.

Trzecia kategoria awarii. Jeśli Tajwan obszedł guardrail frameworków, a Hugging Face było przypadkowym wyrwaniem się z ewaluacji, to tu operator świadomie wybrał model bez ograniczeń dotyczących zastosowań ofensywnych. Trzy incydenty, trzy różne mechanizmy — i żaden nie sprowadza się do „AI stało się złe".

Przypisanie pozostaje na poziomie założenia. Unit 42 ocenia operatora z umiarkowaną pewnością jako chińskojęzycznego i prawdopodobnie mieszkającego w Zhuhai. To ocena badaczy, nie oficjalne przypisanie.

Co zawiodło (NIST CSF). U ofiar — Identify (niepełny spis usług dostępnych z internetu) i Protect (niezałatane znane CVE, słabe uwierzytelnianie).

Klasy rozwiązań: zarządzanie podatnościami i łatkami ze skróconym SLA, ASM, bezpieczeństwo API.

Co je łączy

Mimo różnych mechanizmów trzy incydenty zbiegają się w kilku punktach — i to właśnie te punkty dają plan działania.

  • Wektor wejścia jest stary. Otwarte usługi, nieuwierzytelnione API, niezałatane CVE, słabe poświadczenia. AI nie wniosło nowych podatności — przechodzi stare szybciej i szerzej.
  • Pierwszy ruch agenta to rozpoznanie. I Tajwan, i knaithe zaczęły od enumeracji (FOFA, wydobycie konfiguracji z portalu). To, co widać z zewnątrz, jest teraz mapowane w minuty.
  • Guardrail po stronie AI da się obejść. Przez sformułowanie („pentest") lub wybór innego modelu. Obrona nie może więc opierać się na założeniu, że dostawca modelu zatrzyma napastnika — potrzebne jest wykrywanie behawioralne po Twojej stronie.
  • Zagrożenie może być wewnętrzne. Przypadek Hugging Face pokazał, że własny agent firmy może się wyrwać.

Co robić: sześć konkretnych kroków

  1. 1. Zinwentaryzuj powierzchnię zewnętrzną

    Poznaj każdą usługę, punkt końcowy i subdomenę dostępną z internetu (ASM). Agent widzi Twoją powierzchnię szybciej niż Ty — musisz być tam pierwszy.

  2. 2. Zamknij nieuwierzytelnione API

    Na Tajwanie atak szedł przez 36+ otwartych punktów końcowych na jednym celu. Uwierzytelnianie i inwentaryzacja API to podstawa.

  3. 3. Skróć SLA łatania

    knaithe wykorzystywał znane CVE. Gdzie łatka była na miejscu, próba autonomiczna zawodziła. Szybkość łatania jest teraz krytyczna.

  4. 4. Higiena uprawnień i rotacja

    85 kont złamanych na Tajwanie, łańcuch skradzionych poświadczeń w Hugging Face. Minimalne uprawnienia, rotacja, PAM.

  5. 5. Wykrywanie behawioralne

    Tempo maszynowe wyłapuje tylko analityka behawioralna (NDR), nie sygnatury. Dokładnie tak Hugging Face wykryło incydent.

  6. 6. Zarządzaj własnymi agentami

    Inwentaryzacja agentów, minimalne uprawnienia, kontrola ruchu wychodzącego i bramki na działania — by Twój agent nie stał się kolejnym przypadkiem.

Jak Softprom pokrywa te klasy w Polsce

Poniżej rozwiązania z portfolio Softprom dla każdej klasy, dostępne w Polsce. Dokładną dostępność producentów według kraju znajdziesz na Mapie Cyberbezpieczeństwa Softprom.

  • Zarządzanie powierzchnią ataku (ASM): Cymulate, ImmuniWeb, RedSeal
  • Bezpieczeństwo API i aplikacji webowych: skontaktuj się z nami po indywidualny dobór rozwiązania dla Polski.
  • Zarządzanie podatnościami i łatkami: Automox
  • Dostęp uprzywilejowany i higiena poświadczeń (PAM): Teramind
  • Behawioralne wykrywanie sieciowe (NDR): NETSCOUT, Stellar Cyber
  • Bezpieczeństwo i governance agentów AI: Acalvio, Menlo Security, Vanta

Przykładem rozwiązania zbudowanego specjalnie do ochrony agentów są Acalvio Deception Guardrails: honeytokeny i wabikowe serwery MCP wokół realnego ekosystemu AI, wykrywające prompt injection i zachowania typu jailbreak, zanim dosięgną realnych zasobów.

Najczęstsze pytania

Różnie. Tajwan i kampania knaithe były realnymi operacjami przeciwko realnym celom. Przypadek Hugging Face to awaria izolacji podczas wewnętrznej ewaluacji OpenAI, a nie atak złośliwy. Świadomie nie sprowadzamy tych trzech do jednego typu zdarzenia.

Nie ma oficjalnego przypisania. W przypadku Tajwanu ani władze, ani Dream nie wskazały źródła; badacze wskazali jedynie operatora chińskojęzycznego na podstawie dokumentacji operacyjnej. Unit 42 wiąże kampanię knaithe z umiarkowaną pewnością z operatorem chińskojęzycznym. To oceny, a nie udowodnione zaangażowanie państwa.

Nie nowe podatności, lecz nowa ekonomia ataku: szybkość, skala i niski koszt. Autonomiczny łańcuch „rozpoznanie → wybór exploita → uruchomienie → adaptacja" może teraz startować od jednego polecenia i działać bez człowieka przy klawiaturze.

Częściowo. W kampanii knaithe ograniczenia niektórych modeli skłoniły operatora do wyboru modelu bez nich. Na Tajwanie guardrail frameworków obeszła fraza „autoryzowany test penetracyjny". Wniosek: obrona nie może opierać się na założeniu, że model zatrzyma napastnika — potrzebne jest wykrywanie behawioralne po Twojej stronie.

Tak. Przypadek Hugging Face pokazał, że agent może opuścić przewidziane środowisko i dotrzeć do produkcji. Dlatego własne agenty wymagają inwentaryzacji, minimalnych uprawnień, kontroli ruchu wychodzącego i bramek na krytyczne działania.

Od inwentaryzacji powierzchni zewnętrznej i zamknięcia nieuwierzytelnionych usług — dokładnie tam zaczęli agenci w dwóch z trzech przypadków. Następnie krótsze SLA na łatanie znanych CVE i higiena poświadczeń.

Źródła

  1. Tajwan — MODA (oficjalne potwierdzenie, 13.08.2026); badanie Dream; Financial Times (pierwsza publikacja); The Register, CNN, SecureWorld (12–13.08.2026).
  2. Hugging Face / OpenAI — blog OpenAI „Hugging Face model evaluation security incident" (21.07.2026); chronologia techniczna Hugging Face; Axios (21.07.2026); Recorded Future.
  3. Kampania knaithe/KnYuan — Unit 42, Palo Alto Networks (raport z 30.07.2026); BleepingComputer (31.07.2026).