Google Cloud TPU v6e: benchmark Gemma 3 dla LLM
News | 14.09.2026
Przeniesienie Large Language Models z prototypów do środowiska produkcyjnego ujawnia prostą prawdę: infrastruktura wyznacza zarówno pułap wydajności, jak i ekonomikę usługi. Standardowe benchmarki często pomijają kluczowy fakt — nie wszystkie zapytania LLM obciążają układy w ten sam sposób. Inżynierowie Google Cloud przetestowali Gemma 3 12B i 27B na TPU v6e, aby pokazać, jak platforma zachowuje się przy strukturalnie odmiennych obciążeniach na dużą skalę.
Co zostało ogłoszone
Google Cloud opublikował badanie wydajności Gemma 3 12B i Gemma 3 27B na TPU v6e z wykorzystaniem vLLM na klastrze GKE Autopilot z topologią 2x2. Testowano dwa profile obciążenia przy 16, 32, 64 i 128 równoczesnych użytkownikach: klasyfikacja (ISL ~4000 tokenów, OSL ~10 tokenów) i generowanie (ISL 500 tokenów, OSL ~1000 tokenów).
Model 27B osiąga barierę wydajności w zadaniach generowania i plateauuje na poziomie 4.12x znormalizowanego mnożnika przepustowości przy 128 użytkownikach. Model 12B skaluje się do 8.19x. W klasyfikacji oba modele osiągają zbliżone wartości 6.04x–6.37x — dla zadań prefill rozmiar modelu ma znacznie mniejsze znaczenie.
Dlaczego ma to znaczenie
Dla CIO, CTO i architektów infrastruktury wyniki te wpływają bezpośrednio na koszty i niezawodność usługi. Nietrafiony wybór modelu do konkretnego obciążenia po cichu zwiększa koszty TPU/GPU lub prowadzi do utraty zapytań pod obciążeniem szczytowym. Benchmarki dostarczają danych do właściwego dobierania modeli oraz konfiguracji autoskalowania w oparciu o metryki End-to-End latency, a nie o CPU czy pamięć.
Szczegóły techniczne
- Sprzęt: Google Cloud TPU v6e, single-host node pool, topologia 2x2 na GKE Autopilot.
- Stos serwujący: vLLM z pluginem vllm-project/tpu-inference.
- Modele: Gemma 3 12B i Gemma 3 27B (open weights, HuggingFace).
- Konfiguracja globalna: max-model-len=128000, max-num-batched-tokens=8192, max-num-seqs=512.
- Generowanie: Gemma 3 12B osiąga 8.19x przy 128 użytkownikach; 27B plateauuje na 4.12x powyżej 64 użytkowników.
- Klasyfikacja: oba modele osiągają 6.04x–6.37x bez nasycenia TPU.
- Rekomendacja: skalowanie w oparciu o E2E latency oraz optymalizacja VLLM_TPU_BUCKET_PADDING_GAP.
Efektywna kosztowo infrastruktura AI wymaga precyzyjnego dopasowania wyboru modelu i konfiguracji serwowania do rzeczywistych profili wejścia i wyjścia obciążeń produkcyjnych
Softprom i Google
Softprom jest oficjalnym partnerem Google. Nasz zespół wspiera przedsiębiorstwa w projektowaniu, wdrażaniu i optymalizacji obciążeń w Google Cloud, w tym platform GKE i TPU do produkcyjnej inferencji LLM.
Zaplanuj wdrożenie LLM na TPU lub ewaluację Gemma 3 w Google Cloud z ekspertami Google w Softprom.
Treść przygotowana w ramach projektu Softprom DistriFlow — zautomatyzowanego systemu monitorowania i adaptacji aktualności vendorów. Źródło: artykuł oryginalny.