News

Google Cloud Fault Injection Testing in Preview

News | 31.08.2026

Google Cloud stellt Fault Injection Testing (FIT) in der Preview vor — einen nativen Dienst, der Entwicklern und Architekten hilft, die Ausfallsicherheit ihrer Anwendungen zu validieren, bevor reale Vorfälle Kunden betreffen.

Wenn Datenbanken ausfallen und Netzwerkpfade instabil werden, müssen geschäftskritische Cloud-Dienste weiterhin verfügbar bleiben. Hohe Verfügbarkeit zu garantieren ist aufgrund der Komplexität moderner verteilter Systeme zunehmend schwieriger geworden. FIT ermöglicht das gezielte Einbringen von Fehlern in eine produktive Umgebung und die Überprüfung der Schutzmechanismen auf realer Google-Cloud-Infrastruktur.

Was wurde angekündigt

Google Cloud hat Fault Injection Testing (FIT) in der öffentlichen Preview angekündigt. Der Dienst automatisiert Ausfalltests, damit Teams ein vorhersehbares Verhalten während Störungen sicherstellen können. In der ersten Preview stehen zwei Szenarien zur Verfügung:

  • Failover Cloud SQL: löst ein Failover einer hochverfügbaren Cloud-SQL-Instanz von der primären in die Standby-Zone aus.
  • Degrade application traffic: fügt gezielt Latenzen und HTTP-Fehlercodes über einen Layer-7-Load-Balancer hinzu.

Partner wie KeyBank und Servier nutzen FIT bereits zur Validierung ihrer Deployments und zur Simulation zonaler Ausfälle.

Warum dies relevant ist

Für CIOs, CISOs, IT-Leiter und Einkaufsverantwortliche stellt eine nicht validierte Ausfallsicherheit ein direktes Geschäftsrisiko dar. In der Cloud haben Teams weniger direkten Zugriff auf die Infrastruktur als in eigenen Rechenzentren. Ohne native Werkzeuge zur Überprüfung der Überlebensfähigkeit von Anwendungen entstehen drei konkrete Risiken:

  • Verlust von Vertrauen und Reputation: häufige Ausfälle führen zu Kundenunzufriedenheit und langfristigem Markenschaden.
  • Regulatorische Sanktionen: insbesondere im Finanzsektor können fehlende Disaster-Recovery-Nachweise zu Audits und Bußgeldern führen.
  • Verzögerungen bei Migrationen: großflächige Migrationen stocken, wenn Teams die Stabilität kritischer Anwendungen bei einem Zonenausfall nicht nachweisen können.

Technische Details

  • Experimentvorlagen: definieren den konkreten Fehler und die Zielressourcen des Experiments.
  • Automatisierter Dry-Run: eine Read-only-Simulation prüft Berechtigungen und listet alle betroffenen Ressourcen auf.
  • Manueller Start und automatisches Revert: Injektionen laufen für eine definierte Dauer und werden nach Ablauf des Timers automatisch zurückgesetzt.
  • Stop and Revert: ermöglicht das sofortige Anhalten des Experiments und die Wiederherstellung der Ressourcen.
  • Zugriff: über Google Cloud Console, gcloud CLI und REST APIs.
  • Benötigte Rolle: roles/faulttesting.operator zur Konfiguration und Ausführung von Experimenten.
  • Empfehlung: FIT während der Preview in einer Nicht-Produktionsumgebung einsetzen.

Durch das gezielte Einbringen von Fehlern in Ihre Umgebung können Sie Ihre Schutzmechanismen überprüfen, bevor ein realer Ausfall Ihre Kunden betrifft

Google Cloud Networking Team

Softprom und Google

Softprom ist der offizielle Partner von Google. Das Team von Softprom unterstützt Unternehmen bei der Planung, Implementierung und Validierung von Google-Cloud-Architekturen, einschließlich Resilience Engineering, Chaos Experimentation und Disaster-Recovery-Tests.

Dieser Inhalt wurde im Rahmen des Projekts Softprom DistriFlow erstellt — eines automatisierten Systems zur Überwachung und Anpassung von Vendor-News. Quelle: Originalartikel.