News

Google Cloud TPU v6e: бенчмарк Gemma 3 для LLM-навантажень

News | 14.09.2026

Перехід LLM з прототипів у промислову експлуатацію відкриває просту істину: інфраструктура визначає і межу продуктивності, і економіку сервісу. Стандартні бенчмарки часто ігнорують ключовий факт — не всі запити до LLM однаково навантажують чіпи. Інженери Google Cloud протестували Gemma 3 12B та 27B на TPU v6e, щоб відповісти, як платформа поводиться під структурно різними навантаженнями у масштабі.

Що було анонсовано

Google Cloud опублікував дослідження продуктивності Gemma 3 12B та Gemma 3 27B на TPU v6e з використанням vLLM на кластері GKE Autopilot з топологією 2x2. Тестувалися два профілі навантажень при 16, 32, 64 та 128 паралельних користувачах: класифікація (ISL ~4000 токенів, OSL ~10 токенів) та генерація (ISL 500 токенів, OSL ~1000 токенів).

Модель 27B досягає стелі продуктивності на генерації — 4.12x нормалізованого множника пропускної здатності при 128 користувачах, тоді як 12B масштабується до 8.19x. У класифікації обидві моделі показують близькі пікові значення 6.04x–6.37x, що свідчить: для prefill-навантажень розмір моделі має значно менше значення.

Чому це важливо

Для CIO, CTO та архітекторів інфраструктури дослідження безпосередньо впливає на витрати та надійність сервісу. Невдалий вибір моделі під конкретне навантаження мовчки збільшує рахунок за TPU/GPU або спричиняє втрату запитів на піку. Дані бенчмарка дають чіткі орієнтири для правильного розміщення моделей та налаштування автомасштабування за метриками End-to-End latency, а не за CPU чи пам’яттю.

Технічні деталі

  • Апаратна база: Google Cloud TPU v6e, single-host node pool, топологія 2x2 на GKE Autopilot.
  • Стек інференсу: vLLM через плагін vllm-project/tpu-inference.
  • Моделі: Gemma 3 12B та Gemma 3 27B (open weights, HuggingFace).
  • Глобальна конфігурація: max-model-len=128000, max-num-batched-tokens=8192, max-num-seqs=512.
  • Генерація: Gemma 3 12B досягає 8.19x при 128 користувачах; 27B зупиняється на 4.12x після 64 користувачів.
  • Класифікація: обидві моделі виходять на 6.04x–6.37x без насичення TPU.
  • Рекомендація: масштабувати за E2E latency та застосовувати оптимізацію VLLM_TPU_BUCKET_PADDING_GAP.

Ефективна AI-інфраструктура вимагає точного узгодження вибору моделі та конфігурації сервінгу з профілем вхідних і вихідних токенів реального навантаження

Команда Google Cloud

Softprom та Google

Softprom є офіційним партнером Google. Наша команда допомагає підприємствам проєктувати, розгортати й оптимізувати робочі навантаження в Google Cloud, включно з GKE та TPU-платформами для промислового LLM-інференсу.

Цей матеріал підготовлено в рамках проєкту Softprom DistriFlow — автоматизованої системи моніторингу та адаптації новин вендорів. Джерело: оригінальна стаття.