
Google DeepMind가 내놓은 AI 에이전트용 신모델 3종
Google DeepMind의 Gemini 3.6 Flash, 3.5 Flash-Lite, Gemma 4는 AI 에이전트를 위한 3티어 스택을 이룹니다. 지연 시간, 비용, 도구 사용, 배포 제어를 비교해 보세요.
한 줄로 압축하면 이렇습니다. 저렴한 1차 라우팅에는 Gemini 3.5 Flash-Lite 를, 핵심 에이전트 작업에는 Gemini 3.6 Flash 를, 자체 시스템에서 돌려야 할 때는 Gemma 4 를 사용하세요.
짧게 정리하면, 이 글은 AI 에이전트에 가장 중요한 항목인 지연 시간, 비용, 도구 사용, 멀티모달 입력, 플래닝, 배포 제어를 기준으로 세 모델을 비교합니다. 하나는 대량 트리아지용, 하나는 일상적 실행용, 하나는 셀프 호스팅 및 프라이빗 워크로드용으로 만들어졌습니다.
제게 가장 인상적이었던 것은 다음과 같습니다.
- Gemini 3.5 Flash-Lite는 분류·추출·라우팅을 위한 저비용 트래픽 분배기로, 200ms 미만의 지연 시간을 제공
- Gemini 3.6 Flash는 도구 호출, 문서 작업, 워크플로 단계를 담당하는 중간의 주력 모델로, 지연 시간은 약 ~500ms
- Gemma 4는 트레이드오프를 오픈 웨이트, Apache 2.0 라이선스, 로컬 배포, 프라이빗 데이터 처리 쪽으로 이동
- Gemma 4는 2.3B에서 31B 파라미터까지 제공되며, 최대 256K 컨텍스트 지원
- 26B A4B MoE 버전은 추론 시 25.2B 중 3.8B 파라미터를 활성화
- 티어 구성은 단순 작업을 작은 모델에 두고 어려운 건만 큰 모델로 보내 지출을 낮출 수 있음
빠르게 선택해야 한다면,
라우팅에는 Flash-Lite, 실행에는 Flash, 셀프 호스팅 제어에는 Gemma 4를 고르세요.

Google의 3.6 Flash가 증명하는 AI 에이전트의 저비용 시대
빠른 비교
| 모델 | 최적 용도 | 지연 시간 | 배포 | 주요 트레이드오프 |
|---|---|---|---|---|
| Gemini 3.5 Flash-Lite | 분류, 추출, 라우팅 | <200 ms | Google AI Studio / Vertex AI | 얕은 추론 깊이 |
| Gemini 3.6 Flash | 핵심 에이전트 실행, 도구 사용, 긴 컨텍스트 작업 | ~500 ms | Google AI Studio / Vertex AI | Lite보다 높은 비용 |
| Gemma 4 | 프라이빗·규제·오프라인 에이전트 작업 | 하드웨어에 따라 다름 | 셀프 호스팅 / 프라이빗 클라우드 | 더 많은 인프라 작업 |
다시 말해, 이것은 하나의 "최고" 모델을 고르는 문제가 아닙니다. 통합 LLM API를 활용해 각 모델을 알맞은 작업에 매칭하고, 에이전트 스택을 빠르고 비용에 민감하며 필요한 곳에서는 통제 가능하게 유지하는 문제입니다.
1. Gemini 3.6 Flash

에이전트 워크로드 적합성
세 모델 중 Gemini 3.6 Flash는 처리량 우선 옵션입니다. 낮은 지연 시간, 안정적인 비용, 빠른 처리 시간이 필요한 대량 에이전트에 사용하세요.
지연 시간과 처리량
그래서 티켓 트리아지, 문서 조회, 대규모 작업 라우팅 같은 요청이 많은 플로에 잘 맞습니다. 이런 경우 모델이 안정적이고 신뢰할 수 있게 동작해야 할 때 속도가 가장 중요합니다.
도구 사용과 커스터마이징
함수 호출, 검색, 정책 검사, 사람의 승인 단계와 결합해 자동화를 통제할 수 있습니다. 예를 들어 요청을 읽고, 원본 문서를 가져오고, 도구를 호출하고, 엣지 케이스는 사람에게 보내는 에이전트에 잘 어울립니다.
다음으로, Gemini 3.5 Flash-Lite는 트레이드오프를 더 가볍고 저렴한 에이전트 작업 쪽으로 이동시킵니다.
2. Gemini 3.5 Flash-Lite

에이전트 워크로드 적합성
Gemini 3.5 Flash-Lite는 대량 분류, 추출, 라우팅을 위한 기본 저비용 모델입니다. 에이전트 스택의 가벼운 제어 계층이라고 생각하세요. 트래픽의 대부분을 처리하고, 더 어려운 판단에는 큰 모델이 개입합니다.
지연 시간과 처리량
200ms 미만의 지연 시간 덕분에 팬아웃 워크플로, 배칭, 빠른 라우팅에 잘 맞습니다. 에이전트 시스템이 큰 작업 하나를 여러 작은 작업으로 쪼갤 때, Flash-Lite가 그 하위 작업들을 빠르게 처리한 뒤 결과를 취합용으로 돌려줄 수 있습니다.
비용과 배포 모델
낮은 비용 덕분에 단순 작업 대기열의 기본 1차 모델이 됩니다. 이 구성보다 배포 제어와 오픈 웨이트가 더 중요하다면, Gemma 4가 그 트레이드오프를 바꿔 줍니다.
도구 사용과 커스터마이징
Flash-Lite는 구조화된 출력과 라우팅·추출을 위한 가벼운 작업 튜닝을 지원합니다. 흔한 패턴은 간단합니다. Flash-Lite를 1차 분류기나 추출기로 쓰고, 엣지 케이스만 더 강한 모델로 보내는 것입니다. 그러면 큰 에이전트들이 플래닝, 멀티모달 추론, 어려운 예외 처리를 위해 무거운 모델을 아껴 쓸 수 있습니다.
3. Gemma 4

에이전트 워크로드 적합성
Gemma 4는 로컬에서 실행되고, 민감한 데이터를 다루며, 튜닝이 쉬워야 하는 에이전트 스택을 위한 제어 우선 선택지입니다. Apache 2.0 라이선스 덕분에 팀이 로컬 시스템에서 파인튜닝하고 배포할 수 있어, 엄격한 데이터 거버넌스 규칙이 있는 규제 환경이나 오프라인 환경에 맞습니다. 데이터가 로컬 시스템을 떠나기 전에 유입 지점에서 PII를 마스킹할 수도 있어 헬스케어와 금융 팀에 유용합니다 [1].
이것이 중요한 이유는 로컬 제어가 단지 프라이버시만의 문제가 아니기 때문입니다. 모델을 얼마나 튜닝할 수 있는지, 어디서 실행할지, 어떤 워크로드를 감당할 수 있는지 결정하는 문제이기도 합니다. Gemma 4에서 그것은 모델 크기, 컨텍스트 윈도, 런타임 비용으로 귀결됩니다.
지연 시간과 처리량
Gemma 4는 2.3B 모바일 모델부터 31B 서버 모델까지 제공됩니다. 덕분에 하나의 모델에 모든 것을 강요하는 대신 작업에 맞는 모델을 고를 여지가 생깁니다. 작은 모델은 엣지 작업을 처리하고, 큰 모델은 플래닝이나 긴 컨텍스트 추론을 맡을 수 있습니다.
여기서 26B A4B MoE 변형이 돋보입니다. 추론 시 25.2B 중 3.8B 파라미터를 활성화해 런타임 효율을 높입니다. 컨텍스트 길이는 작은 모델이 128K 토큰을, 12B·26B A4B·31B 모델이 256K 토큰을 지원합니다. 긴 문서와 긴 에이전트 트레이스에 잘 맞습니다 [1].
비용과 배포 모델
Gemma 4를 자체 하드웨어에서 돌리면 토큰당 API 요금은 사라지지만, 청구서 자체가 사라지는 것은 아닙니다. 비용이 서버, 스케일링, 가동 시간으로 옮겨갈 뿐입니다. 즉, 프로바이더에게 내는 대신 모델 뒤의 스택에 비용을 내는 셈입니다.
Gemma 4는 메모리 사용을 줄이는 몇 가지 방법도 제공합니다. Quantization-Aware Training(QAT) 체크포인트가 GGUF, 모바일 최적화 wNa8o8, Compressed Tensors w4a16 포맷으로 제공됩니다. 출력 품질을 bfloat16에 가깝게 유지하면서 메모리 요구량을 낮출 수 있습니다 [1].
이런 구성 덕분에 에이전트가 로컬 제어와 구조화된 실행을 필요로 하고, 팀이 그에 따르는 인프라를 관리할 준비가 되어 있을 때 이 모델은 강력한 선택이 됩니다.
도구 사용과 커스터마이징
Gemma 4는 네이티브 함수 호출과 네이티브 시스템 역할을 지원해, 에이전트 개발자가 대화 흐름과 작업 실행을 더 직접적으로 제어할 수 있게 해줍니다 [1]. 또한 transformers, vLLM, llama.cpp와도 호환되므로 [1], 많은 팀이 이미 쓰는 스택에 바로 끼워 넣을 수 있습니다.
Unified 12B 변형은 이미지와 오디오 입력을 직접 받을 수 있습니다. 텍스트·이미지·오디오 입력에 걸쳐 하나의 파인튜닝 경로가 필요한 멀티모달 에이전트에 유용합니다 [1].
Gemma 4에는 내장 "Thinking" 모드도 있습니다. 어려운 작업에 도움이 되지만 지연 시간이 늘어납니다. 쉽게 말해, 플래닝과 복잡한 추론에 쓰고 빠른 라우팅에는 쓰지 마세요 [1]. 결국 Gemma 4는 제어에 강하게 기울지만, 그 제어에는 인프라 부담과 약간의 속도 트레이드오프가 따릅니다.
트레이드오프, 통합 옵션, 장단점
이 모델들을 하나의 스택으로 보면, 트리아지·실행·로컬 제어라는 세 가지 역할로 꽤 깔끔하게 나뉩니다.
그래서 핵심 결정은 단지 어떤 모델이 최고인가 가 아닙니다. 하나의 모델이 모든 것을 처리하게 할지, 아니면 각 모델이 가장 잘하는 부분을 맡는 티어 구성을 택할지의 문제입니다.
티어 아키텍처는 복잡한 엔터프라이즈 규모의 에이전트에 가장 잘 맞는 경향이 있습니다. Flash-Lite는 가장 낮은 지연 시간과 비용으로 대량 트리아지와 라우팅을 맡을 수 있습니다. Gemini 3.6 Flash는 핵심 워크플로 실행, 도구 사용, 긴 컨텍스트 작업을 처리할 수 있습니다. Gemma 4는 셀프 호스팅이나 프라이빗 클라우드 배포가 필요한 규제·프라이빗 워크로드에 맞습니다.
이렇게 쓰면, 모든 요청을 하나의 고성능 모델로 보내는 것과 비교해 팀이 비용을 의미 있게 줄일 수 있습니다. 그 시점에서 트레이드오프는 배포 제어 vs. 운영 단순성으로 이동합니다.
텍스트 추론을 벗어난 이미지·비디오 생성에는 APIMart 가 단일 멀티모달 API를 통해 작업을 라우팅할 수 있습니다.
아래 표는 주요 통합 경로를 요약합니다.
| 모델 / 구성 | 통합 경로 | 지연 시간 | 비용 프로필 | 핵심 트레이드오프 |
|---|---|---|---|---|
| APIMart(통합 게이트웨이) | 단일 API → 500+ 모델 | 오케스트레이터에 따라 다름 | 사용량 기반 | 관리형 계층 의존성 추가 |
| Gemini 3.5 Flash-Lite | Google AI Studio / Vertex AI | <200 ms | 최저 | 깊은 추론 제한 |
| Gemini 3.6 Flash | Google AI Studio / Vertex AI | ~500 ms | 중간 | Lite보다 높은 비용 |
| Gemma 4(셀프 호스팅) | vLLM / llama.cpp / 프라이빗 클라우드 | 하드웨어에 따라 다름 | 높음(인프라 비용) | 무거운 유지보수 부담, 완전한 데이터 소유권 |
| 티어 구성 | 오케스트레이터(예: LangChain) | 혼합 / 최적화 | 최적화 | 디버깅과 추적이 어려움, 하이브리드 제어 |
실제로 이 트레이드오프는 꽤 단순한 선택으로 이어집니다. 하나의 모델을 처음부터 끝까지 쓸 것인가, 아니면 라우팅·실행·프라이빗 워크로드를 서로 다른 계층으로 나눌 것인가입니다.
결론
알맞은 모델은 세 가지로 결정됩니다. 작업 복잡도, 예산, 배포 제어입니다.
이 렌즈로 보면 Gemini 3.5 Flash-Lite는 가벼운 라우팅을 위한 첫 번째 선택입니다. 대량 라우팅과 추출 작업에 잘 맞습니다. 분류, 추출, 1차 라우팅에 사용하세요. 작업에 더 많은 조율이 필요하면 Gemini 3.6 Flash로 올라가세요.
Gemini 3.6 Flash는 프로덕션 에이전트를 위한 기본 실행 계층으로 작동합니다. Flash-Lite의 낮은 비용과 Gemma 4의 제어 우선 배포 사이에 위치해, 대규모에서 강력한 출력을 원하는 팀에게 견실한 기본값입니다. 배포 제어가 가장 중요하다면 Gemma 4가 더 나은 선택이 됩니다.
Gemma 4는 제어, 프라이버시, 오프라인 접근이 필요한 팀을 위해 만들어졌습니다. 온디바이스 또는 셀프 호스팅 처리와 로컬 PII 마스킹을 지원하므로 규제 환경에 맞습니다. 오픈 웨이트 덕분에 도메인 파인튜닝도 더 간단해집니다.
라우팅에는 Flash-Lite, 실행에는 Gemini 3.6 Flash, 셀프 호스팅 제어에는 Gemma 4를 사용하세요.
FAQ
티어 모델 구성은 언제 사용해야 하나요?
앱이 성장하면서 성능, 비용, 안정성의 균형을 맞춰야 할 때 티어 모델 구성을 사용하세요.
기본 아이디어는 이렇습니다. 단순하고 대량인 작업은 저비용 모델로 보내고, 프런티어 모델은 복잡하고 중요한 작업을 위해 아껴두는 것입니다.
이 분배는 API 비용을 60%~80% 줄일 수 있으며, 특히 가벼운 모델이 신뢰도 임계값을 충족하지 못한 후에만 요청을 에스컬레이션할 때 효과적입니다.
트레이드오프는 꽤 단순합니다. 가장 발전한 모델이 모든 일상 작업을 처리할 필요는 없습니다. 가벼운 모델이 먼저 시도하게 하고, 작업이 요구할 때만 무거운 모델을 투입하세요.
Gemini 3.6 Flash와 Gemma 4 중 어떻게 골라야 하나요?
가장 중요한 것이 무엇인지에 따라 고르세요. 속도, 규모, 아니면 제어입니다.
Gemini 3.6 Flash는 낮은 지연 시간의 대량 작업을 위해 만들어진 고성능 멀티모달 모델입니다. 실시간 앱과 비용에 민감한 워크플로에 잘 맞습니다.
Gemma 4는 로컬 배포나 자체 인프라에서의 실행처럼 더 많은 제어와 유연성을 원할 때 더 합리적입니다. 빠르고 확장 가능한 프로덕션에는 Gemini 3.6 Flash를, 프라이빗·온디바이스 사용이나 커스텀 파인튜닝에는 Gemma 4를 선택하세요.
Flash-Lite에 가장 잘 맞는 에이전트 작업은 무엇인가요?
Flash-Lite는 깊은 추론보다 효율이 더 중요한 대량·비용 민감 작업에 잘 맞습니다. 특히 기본적인 데이터 추출과 분류에 강합니다.
모델 캐스케이드의 첫 번째 계층으로도 잘 작동합니다. 많은 구성에서 어려운 쿼리를 프리미엄 모델로 보내기 전에 요청의 70%~85% 를 처리할 수 있습니다. 그러면 표준 에이전트 워크플로를 안정적으로 유지하면서 비용을 60%~75% 줄일 수 있습니다.
모델 마켓에서 원하는 모델을 선택하세요
APIMart 모델 마켓에서 채팅, 이미지, 비디오 모델을 사용해 보고 하나의 통합 API로 모델 기능을 빠르게 경험하세요.