News

Google Cloud TPU v6e: бенчмарк Gemma 3 для LLM-нагрузок

News | 14.09.2026

Переход LLM из прототипов в промышленную эксплуатацию открывает простую истину: инфраструктура определяет и потолок производительности, и экономику сервиса. Стандартные бенчмарки часто игнорируют ключевой факт — не все запросы к LLM одинаково нагружают чипы. Инженеры Google Cloud протестировали Gemma 3 12B и 27B на TPU v6e, чтобы показать, как платформа ведёт себя при структурно разных нагрузках в масштабе.

Что было анонсировано

Google Cloud опубликовал исследование производительности Gemma 3 12B и Gemma 3 27B на TPU v6e с использованием vLLM в кластере GKE Autopilot с топологией 2x2. Тестировались два профиля нагрузки при 16, 32, 64 и 128 параллельных пользователях: классификация (ISL ~4000 токенов, OSL ~10 токенов) и генерация (ISL 500 токенов, OSL ~1000 токенов).

Модель 27B достигает потолка на генерации — 4.12x нормализованного множителя пропускной способности при 128 пользователях, тогда как 12B масштабируется до 8.19x. В классификации обе модели показывают близкие пиковые значения 6.04x–6.37x, что означает: для prefill-нагрузок размер модели имеет значительно меньшее значение.

Почему это важно

Для CIO, CTO и архитекторов инфраструктуры это исследование напрямую влияет на стоимость и надёжность сервиса. Неверный выбор модели под нагрузку молча увеличивает счёт за TPU/GPU или приводит к потерям запросов на пике. Данные бенчмарка дают чёткие ориентиры для правильного размещения моделей и настройки автомасштабирования по метрикам End-to-End latency, а не по CPU или памяти.

Технические детали

  • Аппаратная база: Google Cloud TPU v6e, single-host node pool, топология 2x2 на GKE Autopilot.
  • Стек инференса: vLLM через плагин vllm-project/tpu-inference.
  • Модели: Gemma 3 12B и Gemma 3 27B (open weights, HuggingFace).
  • Глобальная конфигурация: max-model-len=128000, max-num-batched-tokens=8192, max-num-seqs=512.
  • Генерация: Gemma 3 12B выходит на 8.19x при 128 пользователях; 27B останавливается на 4.12x после 64 пользователей.
  • Классификация: обе модели достигают 6.04x–6.37x без насыщения TPU.
  • Рекомендация: масштабировать по E2E latency и применять оптимизацию VLLM_TPU_BUCKET_PADDING_GAP.

Эффективная AI-инфраструктура требует точного соответствия выбора модели и конфигурации сервинга профилю входных и выходных токенов реальной нагрузки

Команда Google Cloud

Softprom и Google

Softprom является официальным партнёром Google. Наша команда помогает предприятиям проектировать, разворачивать и оптимизировать нагрузки в Google Cloud, включая GKE и TPU-платформы для промышленного LLM-инференса.

Этот материал подготовлен в рамках проекта Softprom DistriFlow — автоматизированной системы мониторинга и адаптации новостей вендоров. Источник: оригинальная статья.