News

Google Cloud TPU v6e: benchmark Gemma 3 dla LLM

News | 14.09.2026

Przeniesienie Large Language Models z prototypów do środowiska produkcyjnego ujawnia prostą prawdę: infrastruktura wyznacza zarówno pułap wydajności, jak i ekonomikę usługi. Standardowe benchmarki często pomijają kluczowy fakt — nie wszystkie zapytania LLM obciążają układy w ten sam sposób. Inżynierowie Google Cloud przetestowali Gemma 3 12B i 27B na TPU v6e, aby pokazać, jak platforma zachowuje się przy strukturalnie odmiennych obciążeniach na dużą skalę.

Co zostało ogłoszone

Google Cloud opublikował badanie wydajności Gemma 3 12B i Gemma 3 27B na TPU v6e z wykorzystaniem vLLM na klastrze GKE Autopilot z topologią 2x2. Testowano dwa profile obciążenia przy 16, 32, 64 i 128 równoczesnych użytkownikach: klasyfikacja (ISL ~4000 tokenów, OSL ~10 tokenów) i generowanie (ISL 500 tokenów, OSL ~1000 tokenów).

Model 27B osiąga barierę wydajności w zadaniach generowania i plateauuje na poziomie 4.12x znormalizowanego mnożnika przepustowości przy 128 użytkownikach. Model 12B skaluje się do 8.19x. W klasyfikacji oba modele osiągają zbliżone wartości 6.04x–6.37x — dla zadań prefill rozmiar modelu ma znacznie mniejsze znaczenie.

Dlaczego ma to znaczenie

Dla CIO, CTO i architektów infrastruktury wyniki te wpływają bezpośrednio na koszty i niezawodność usługi. Nietrafiony wybór modelu do konkretnego obciążenia po cichu zwiększa koszty TPU/GPU lub prowadzi do utraty zapytań pod obciążeniem szczytowym. Benchmarki dostarczają danych do właściwego dobierania modeli oraz konfiguracji autoskalowania w oparciu o metryki End-to-End latency, a nie o CPU czy pamięć.

Szczegóły techniczne

  • Sprzęt: Google Cloud TPU v6e, single-host node pool, topologia 2x2 na GKE Autopilot.
  • Stos serwujący: vLLM z pluginem vllm-project/tpu-inference.
  • Modele: Gemma 3 12B i Gemma 3 27B (open weights, HuggingFace).
  • Konfiguracja globalna: max-model-len=128000, max-num-batched-tokens=8192, max-num-seqs=512.
  • Generowanie: Gemma 3 12B osiąga 8.19x przy 128 użytkownikach; 27B plateauuje na 4.12x powyżej 64 użytkowników.
  • Klasyfikacja: oba modele osiągają 6.04x–6.37x bez nasycenia TPU.
  • Rekomendacja: skalowanie w oparciu o E2E latency oraz optymalizacja VLLM_TPU_BUCKET_PADDING_GAP.

Efektywna kosztowo infrastruktura AI wymaga precyzyjnego dopasowania wyboru modelu i konfiguracji serwowania do rzeczywistych profili wejścia i wyjścia obciążeń produkcyjnych

Zespół inżynierski Google Cloud

Softprom i Google

Softprom jest oficjalnym partnerem Google. Nasz zespół wspiera przedsiębiorstwa w projektowaniu, wdrażaniu i optymalizacji obciążeń w Google Cloud, w tym platform GKE i TPU do produkcyjnej inferencji LLM.

Treść przygotowana w ramach projektu Softprom DistriFlow — zautomatyzowanego systemu monitorowania i adaptacji aktualności vendorów. Źródło: artykuł oryginalny.