
Три новые модели Google DeepMind для AI-агентов
Gemini 3.6 Flash, 3.5 Flash-Lite и Gemma 4 от Google DeepMind образуют трёхуровневый стек для AI-агентов. Сравниваем задержку, цену, инструменты и контроль.
Если свести всё к одной строке, то так: используйте Gemini 3.5 Flash-Lite для дешёвой первичной маршрутизации, Gemini 3.6 Flash для основной работы агентов и Gemma 4, когда нужно запускать всё на собственных системах.
Вот краткая версия. Статья сравнивает три модели по параметрам, которые важнее всего для AI-агентов: задержка, стоимость, использование инструментов, мультимодальный ввод, планирование и контроль развёртывания. Одна модель создана для высокообъёмной сортировки, другая подходит для повседневного выполнения задач, третья — для самостоятельного хостинга и приватных нагрузок.
Что зацепило меня больше всего:
- Gemini 3.5 Flash-Lite — дешёвый распределитель трафика для классификации, извлечения данных и маршрутизации с задержкой ниже 200 мс
- Gemini 3.6 Flash сидит посередине как главная рабочая лошадка для вызова инструментов, работы с документами и шагов процессов, с задержкой около ~500 мс
- Gemma 4 смещает компромисс в сторону открытых весов, лицензии Apache 2.0, локального развёртывания и приватной обработки данных
- Gemma 4 охватывает диапазон от 2.3B до 31B параметров с контекстом до 256K
- Версия 26B A4B MoE активирует 3.8B из 25.2B параметров при инференсе
- Многоуровневая схема может снизить расходы: простые задачи остаются на малых моделях, а сложные случаи уходят к крупным
Если выбирать быстро:
берите Flash-Lite для маршрутизации, Flash для выполнения и Gemma 4 для контроля при самостоятельном хостинге.

3.6 Flash от Google доказывает: AI-агенты вот-вот станут дешёвыми
Быстрое сравнение
| Модель | Лучшее применение | Задержка | Развёртывание | Главный компромисс |
|---|---|---|---|---|
| Gemini 3.5 Flash-Lite | Классификация, извлечение данных, маршрутизация | <200 мс | Google AI Studio / Vertex AI | Меньшая глубина рассуждений |
| Gemini 3.6 Flash | Основное выполнение задач агентов, инструменты, длинный контекст | ~500 мс | Google AI Studio / Vertex AI | Дороже, чем Lite |
| Gemma 4 | Приватная, регулируемая или офлайн-работа агентов | Зависит от железа | Самостоятельный хостинг / частное облако | Больше работы с инфраструктурой |
Иными словами, речь не о выборе одной «лучшей» модели. Речь о том, чтобы подобрать каждой модели свою задачу через единый LLM API, чтобы ваш агентный стек оставался быстрым, экономным и подконтрольным там, где это нужно.
1. Gemini 3.6 Flash

Соответствие агентным нагрузкам
Из трёх моделей Gemini 3.6 Flash — вариант с приоритетом пропускной способности. Используйте её для высоконагруженных агентов, которым нужны низкая задержка, стабильная стоимость и быстрые ответы.
Задержка и пропускная способность
Это делает её хорошим выбором для потоков с большим числом запросов: сортировка тикетов, поиск по документам или масштабная маршрутизация задач. В таких случаях скорость важнее всего тогда, когда модель должна ещё и действовать стабильно и предсказуемо.
Инструменты и кастомизация
Её можно сочетать с вызовом функций, поиском данных, проверками политик и шагами согласования человеком, чтобы держать автоматизацию под контролем. Например, она хорошо подходит агенту, который читает запрос, подтягивает исходные документы, вызывает инструменты и отправляет пограничные случаи человеку.
Дальше Gemini 3.5 Flash-Lite смещает компромисс в сторону более лёгких и дешёвых агентных задач.
2. Gemini 3.5 Flash-Lite

Соответствие агентным нагрузкам
Gemini 3.5 Flash-Lite — дефолтная дешёвая модель для высокообъёмной классификации, извлечения данных и маршрутизации. Считайте её лёгким управляющим слоем в агентном стеке: она обрабатывает основную массу трафика, а крупные модели подключаются для сложных решений.
Задержка и пропускная способность
Задержка ниже 200 мс делает её сильным вариантом для fan-out-процессов, батчинга и быстрой маршрутизации. Когда агентная система разбивает одну большую работу на множество мелких задач, Flash-Lite может быстро разгрести эти подзадачи и вернуть результаты на консолидацию.
Стоимость и модель развёртывания
Низкая цена делает её моделью первого прохода по умолчанию для больших очередей простых задач. Если контроль развёртывания и открытые веса важнее такой схемы, Gemma 4 меняет этот компромисс.
Инструменты и кастомизация
Flash-Lite поддерживает структурированные выводы и лёгкую донастройку под маршрутизацию и извлечение данных. Типовой паттерн прост: используйте Flash-Lite как первичный классификатор или экстрактор, а к сильной модели отправляйте только пограничные случаи. Так крупные агенты берегут тяжёлые модели для планирования, мультимодальных рассуждений и сложных исключений.
3. Gemma 4

Соответствие агентным нагрузкам
Gemma 4 — выбор с приоритетом контроля для агентных стеков, которым нужно работать локально, иметь дело с чувствительными данными и оставаться простыми в донастройке. Лицензия Apache 2.0 позволяет командам дообучать и развёртывать её на локальных системах, что подходит регулируемым или офлайн-средам со строгими правилами управления данными. Она также может маскировать PII на входе, до того как данные покинут локальные системы, что удобно командам из здравоохранения и финансов [1].
Это важно, потому что локальный контроль — не только про приватность. Это ещё и решение о том, насколько сильно можно тюнить модель, где она работает и какую нагрузку способна нести. Для Gemma 4 всё сводится к размеру модели, контекстному окну и стоимости рантайма.
Задержка и пропускная способность
Gemma 4 масштабируется от мобильной модели на 2.3B до серверной на 31B. Это даёт командам возможность подбирать модель под задачу вместо того, чтобы заставлять одну модель делать всё. Малые модели могут закрывать периферийные задачи, а крупные — брать на себя планирование или рассуждения с длинным контекстом.
Здесь выделяется вариант 26B A4B MoE. При инференсе он активирует 3.8B из 25.2B параметров, что помогает держать рантайм эффективнее. По длине контекста меньшие модели поддерживают 128K токенов, а модели 12B, 26B A4B и 31B — 256K токенов. Это хорошо подходит для длинных документов и длинных трасс агентов [1].
Стоимость и модель развёртывания
Запуск Gemma 4 на собственном железе убирает потокенные API-платежи, но счёт не исчезает. Он переезжает в серверы, масштабирование и аптайм. Вместо оплаты провайдеру вы платите за стек, стоящий за моделью.
Gemma 4 также даёт командам несколько способов урезать потребление памяти. Чекпоинты Quantization-Aware Training (QAT) доступны в форматах GGUF, мобильно-оптимизированном wNa8o8 и Compressed Tensors w4a16. Они снижают требования к памяти, сохраняя качество вывода близким к bfloat16 [1].
Такая конфигурация делает модель сильным вариантом, когда агентам нужны локальный контроль и структурированное выполнение, а команда готова управлять сопутствующей инфраструктурой.
Инструменты и кастомизация
Gemma 4 поддерживает нативный вызов функций и нативную системную роль, что даёт разработчикам агентов более прямой контроль над ходом диалога и выполнением задач [1]. Она также работает с transformers, vLLM и llama.cpp [1], так что встраивается в стеки, которые многие команды уже используют.
Вариант Unified 12B может напрямую принимать изображения и аудио. Это полезно мультимодальным агентам, которым нужен один путь дообучения для текста, изображений и аудио [1].
В Gemma 4 также встроен режим «Thinking». Он помогает на сложных задачах, но добавляет задержку. Проще говоря: используйте его для планирования и сложных рассуждений, а не для быстрой маршрутизации [1]. Так что Gemma 4 делает жёсткую ставку на контроль, но этот контроль требует инфраструктуры и компромиссов по скорости.
Компромиссы, варианты интеграции, плюсы и минусы
Если смотреть на эти модели как на стек, они довольно чисто делятся на три роли: сортировка, выполнение и локальный контроль.
Так что главное решение — не просто какая модель лучше. Вопрос в том, хотите ли вы, чтобы всё делала одна модель, или предпочитаете многоуровневую схему, где каждая модель берёт ту часть, которую делает лучше всех.
Многоуровневая архитектура обычно лучше всего подходит сложным агентам корпоративного масштаба. Flash-Lite может взять высокообъёмную сортировку и маршрутизацию с минимальными задержкой и стоимостью. Gemini 3.6 Flash — основное выполнение процессов, инструменты и работу с длинным контекстом. Gemma 4 подходит регулируемым или приватным нагрузкам, которым нужен самостоятельный хостинг или частное облако.
При таком подходе команды могут ощутимо сократить расходы по сравнению с отправкой каждого запроса в одну более мощную модель. И тогда компромисс смещается: контроль развёртывания против операционной простоты.
Для генерации изображений или видео за пределами текстовых рассуждений APIMart может направлять задачи через единый мультимодальный API.
Таблица ниже суммирует основные пути интеграции.
| Модель / конфигурация | Путь интеграции | Задержка | Профиль стоимости | Ключевой компромисс |
|---|---|---|---|---|
| APIMart (единый шлюз) | Один API → 500+ моделей | Зависит от оркестратора | По использованию | Добавляет зависимость от управляемого слоя |
| Gemini 3.5 Flash-Lite | Google AI Studio / Vertex AI | <200 мс | Самый низкий | Ограниченные глубокие рассуждения |
| Gemini 3.6 Flash | Google AI Studio / Vertex AI | ~500 мс | Умеренный | Дороже, чем Lite |
| Gemma 4 (самостоятельный хостинг) | vLLM / llama.cpp / частное облако | Зависит от железа | Высокий (инфраструктура) | Тяжёлое сопровождение; полное владение данными |
| Многоуровневая схема | Оркестратор (например, LangChain) | Смешанная / оптимизированная | Оптимизированный | Сложнее отлаживать и трассировать; гибридный контроль |
На практике эти компромиссы формируют довольно простой выбор: использовать одну модель от начала до конца или разнести маршрутизацию, выполнение и приватные нагрузки по разным слоям.
Заключение
Правильная модель определяется тремя вещами: сложностью задач, бюджетом и контролем развёртывания.
С этой оптикой Gemini 3.5 Flash-Lite — первый выбор для лёгкой маршрутизации. Она хорошо подходит для высокообъёмной маршрутизации и извлечения данных. Используйте её для классификации, извлечения и первичной маршрутизации. Если задаче нужно больше координации, поднимайтесь до Gemini 3.6 Flash.
Gemini 3.6 Flash работает как слой выполнения по умолчанию для продакшен-агентов. Она находится между более низкой ценой Flash-Lite и контролем Gemma 4, что делает её надёжным дефолтом для команд, которым нужен сильный результат в масштабе. Если контроль развёртывания важнее всего, лучшим выбором становится Gemma 4.
Gemma 4 создана для команд, которым нужны контроль, приватность или офлайн-доступ. Она подходит регулируемым средам, поскольку поддерживает обработку на устройстве или на своём хостинге и локальное маскирование PII. Открытые веса также упрощают доменное дообучение.
Используйте Flash-Lite для маршрутизации, Gemini 3.6 Flash для выполнения и Gemma 4 для контроля при самостоятельном хостинге.
Частые вопросы
Когда стоит использовать многоуровневую схему моделей?
Используйте многоуровневую схему, когда нужно балансировать производительность, стоимость и надёжность по мере роста приложения.
Базовая идея такая: отправляйте простые массовые задачи на дешёвые модели, а флагманские берегите для сложной, ответственной работы.
Такое разделение может сократить расходы на API на 60%–80%, особенно если эскалировать запрос только после того, как лёгкая модель не дотянула до вашего порога уверенности.
Компромисс довольно прост. Не нужно, чтобы самая продвинутая модель обрабатывала каждую рутинную задачу. Пусть лёгкая модель делает первый проход, а тяжёлую подключайте только тогда, когда задача этого требует.
Как выбрать между Gemini 3.6 Flash и Gemma 4?
Выбирайте по тому, что для вас важнее: скорость, масштаб или контроль.
Gemini 3.6 Flash — высокопроизводительная мультимодальная модель для задач с низкой задержкой и большими объёмами. Это делает её сильным вариантом для приложений реального времени и чувствительных к стоимости процессов.
Gemma 4 разумнее, если нужны больший контроль и гибкость — локальное развёртывание или запуск модели на собственной инфраструктуре. Берите Gemini 3.6 Flash для быстрого масштабируемого продакшена. Выбирайте Gemma 4 для приватного использования на устройстве или кастомного дообучения.
Какие агентные задачи лучше всего подходят Flash-Lite?
Flash-Lite хороша для массовой, чувствительной к стоимости работы, где эффективность важнее глубоких рассуждений. Особенно хорошо ей даются базовое извлечение данных и классификация.
Она также отлично работает как первый слой в каскаде моделей. Во многих конфигурациях она способна обработать 70%–85% запросов, прежде чем отправлять более сложные вопросы премиальным моделям. Это может сократить расходы на 60%–75%, сохраняя стабильность стандартных агентных процессов.
Выберите нужную модель в маркетплейсе моделей
Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.