News

Google Cloud TPU v6e: Gemma 3 Benchmark für LLM-Workloads

News | 14.09.2026

Der Übergang von Large Language Models vom Prototyp zum produktiven Einsatz zeigt eine klare Wahrheit: Die Infrastruktur bestimmt sowohl die Leistungsgrenzen als auch die Wirtschaftlichkeit. Standard-Benchmarks blenden dabei einen entscheidenden Punkt aus — nicht alle LLM-Anfragen belasten die Hardware gleich. Google Cloud hat Gemma 3 12B und 27B auf TPU v6e getestet, um zu zeigen, wie die Plattform bei strukturell unterschiedlichen Workloads im großen Maßstab reagiert.

Was wurde angekündigt

Google Cloud hat eine Benchmark-Studie zu Gemma 3 12B und Gemma 3 27B auf TPU v6e veröffentlicht. Getestet wurde mit vLLM auf einem GKE Autopilot Cluster mit 2x2-Chip-Topologie, bei 16, 32, 64 und 128 gleichzeitigen Nutzern. Zwei Workload-Profile wurden verglichen: Klassifikation (ISL ~4000 Token, OSL ~10 Token) und Generierung (ISL 500 Token, OSL ~1000 Token).

Das 27B-Modell stößt bei Generierungsaufgaben an eine Leistungsgrenze und plateauiert bei einem normalisierten Durchsatz-Multiplikator von 4.12x bei 128 Nutzern. Das 12B-Modell skaliert dagegen bis 8.19x. In der Klassifikation erreichen beide Modelle ähnliche Werte von 6.04x bis 6.37x — die Parametergröße spielt bei prefill-lastigen Aufgaben deutlich weniger Rolle.

Warum dies relevant ist

Für CIOs, CTOs und Infrastrukturarchitekten wirken sich diese Erkenntnisse direkt auf Kosten und Servicezuverlässigkeit aus. Eine falsche Modellwahl für ein bestimmtes Workload treibt still die TPU/GPU-Kosten in die Höhe oder führt zu verlorenen Anfragen unter Last. Die Benchmarks bieten datenbasierte Orientierung für das richtige Sizing und für Autoscaling auf Basis der End-to-End-Latenz statt reiner CPU- oder Speicher-Metriken.

Technische Details

  • Hardware: Google Cloud TPU v6e, Single-Host Node Pool, 2x2-Chip-Topologie auf GKE Autopilot.
  • Serving-Stack: vLLM über das Plugin vllm-project/tpu-inference.
  • Modelle: Gemma 3 12B und Gemma 3 27B (Open Weights, via HuggingFace).
  • Globale Konfiguration: max-model-len=128000, max-num-batched-tokens=8192, max-num-seqs=512.
  • Generierung: Gemma 3 12B erreicht 8.19x bei 128 Nutzern; 27B plateauiert bei 4.12x nach 64 Nutzern.
  • Klassifikation: beide Modelle erreichen 6.04x–6.37x ohne TPU-Sättigung.
  • Empfehlung: Skalierung nach E2E-Latenz und Einsatz von VLLM_TPU_BUCKET_PADDING_GAP zur Speicheroptimierung.

Kosteneffiziente AI-Infrastruktur erfordert die präzise Abstimmung von Modellauswahl und Serving-Konfiguration auf die tatsächlichen Input- und Output-Profile produktiver Workloads

Google Cloud Engineering Team

Softprom und Google

Softprom ist der offizielle Partner von Google. Unser Team unterstützt Unternehmen bei der Planung, Bereitstellung und Optimierung von Workloads in Google Cloud, einschließlich GKE- und TPU-basierter Plattformen für produktive LLM-Inferenz.

Dieser Inhalt wurde im Rahmen des Projekts Softprom DistriFlow erstellt — eines automatisierten Systems zur Überwachung und Anpassung von Vendor-News. Quelle: Originalartikel.