Google Cloud TPU v6e: бенчмарк Gemma 3 для LLM-нагрузок
News | 14.09.2026
Переход LLM из прототипов в промышленную эксплуатацию открывает простую истину: инфраструктура определяет и потолок производительности, и экономику сервиса. Стандартные бенчмарки часто игнорируют ключевой факт — не все запросы к LLM одинаково нагружают чипы. Инженеры Google Cloud протестировали Gemma 3 12B и 27B на TPU v6e, чтобы показать, как платформа ведёт себя при структурно разных нагрузках в масштабе.
Что было анонсировано
Google Cloud опубликовал исследование производительности Gemma 3 12B и Gemma 3 27B на TPU v6e с использованием vLLM в кластере GKE Autopilot с топологией 2x2. Тестировались два профиля нагрузки при 16, 32, 64 и 128 параллельных пользователях: классификация (ISL ~4000 токенов, OSL ~10 токенов) и генерация (ISL 500 токенов, OSL ~1000 токенов).
Модель 27B достигает потолка на генерации — 4.12x нормализованного множителя пропускной способности при 128 пользователях, тогда как 12B масштабируется до 8.19x. В классификации обе модели показывают близкие пиковые значения 6.04x–6.37x, что означает: для prefill-нагрузок размер модели имеет значительно меньшее значение.
Почему это важно
Для CIO, CTO и архитекторов инфраструктуры это исследование напрямую влияет на стоимость и надёжность сервиса. Неверный выбор модели под нагрузку молча увеличивает счёт за TPU/GPU или приводит к потерям запросов на пике. Данные бенчмарка дают чёткие ориентиры для правильного размещения моделей и настройки автомасштабирования по метрикам End-to-End latency, а не по CPU или памяти.
Технические детали
- Аппаратная база: Google Cloud TPU v6e, single-host node pool, топология 2x2 на GKE Autopilot.
- Стек инференса: vLLM через плагин vllm-project/tpu-inference.
- Модели: Gemma 3 12B и Gemma 3 27B (open weights, HuggingFace).
- Глобальная конфигурация: max-model-len=128000, max-num-batched-tokens=8192, max-num-seqs=512.
- Генерация: Gemma 3 12B выходит на 8.19x при 128 пользователях; 27B останавливается на 4.12x после 64 пользователей.
- Классификация: обе модели достигают 6.04x–6.37x без насыщения TPU.
- Рекомендация: масштабировать по E2E latency и применять оптимизацию VLLM_TPU_BUCKET_PADDING_GAP.
Эффективная AI-инфраструктура требует точного соответствия выбора модели и конфигурации сервинга профилю входных и выходных токенов реальной нагрузки
Softprom и Google
Softprom является официальным партнёром Google. Наша команда помогает предприятиям проектировать, разворачивать и оптимизировать нагрузки в Google Cloud, включая GKE и TPU-платформы для промышленного LLM-инференса.
Планируйте развёртывание LLM на TPU или тестирование Gemma 3 в Google Cloud с экспертами Google в Softprom.
Этот материал подготовлен в рамках проекта Softprom DistriFlow — автоматизированной системы мониторинга и адаптации новостей вендоров. Источник: оригинальная статья.