
Microsoft, Azure AI 추론에 AMD Helios 추가
Microsoft가 Azure에 AMD Helios 랙 시스템(ND MI455X, 192GB HBM3)을 배포해 AI 추론 처리량을 높이고 지연을 줄이며 대규모 비용을 낮춥니다.
Microsoft는 AMD Helios 시스템을 Azure에 추가해 AI 추론을 대규모로 더 빠르고, 안정적이며, 저렴하게 만듭니다. 채팅, 이미지, 비디오 워크로드를 운영한다면 요약은 간단합니다: 더 높은 처리량, 더 낮은 지연, 그리고 높은 요청량을 위한 더 많은 여유 공간.
바로 챙길 만한 점은 다음과 같습니다:
-
Helios는 단순한 실험실 테스트가 아니라 프로덕션 추론을 겨냥합니다
-
ND MI455X v7 VM은 대규모 LLM 및 멀티모달 작업에 가장 잘 맞는 주요 Azure 옵션입니다
-
MI455X의 192 GB HBM3 메모리는 대형 모델을 위한 더 많은 공간을 제공합니다
-
AMD는 일부 Llama 워크로드가 최대 8배의 향상을 볼 수 있다고 밝힙니다
-
기사는 특수 설정에서 ~750 tokens/sec 대 표준 H100 엔드포인트의 ~100–150 tokens/sec를 언급합니다
-
Azure는 여전히 작업을 스택 전반에 분산합니다:
-
준비 작업을 위한 CPU VM
-
무거운 추론을 위한 GPU VM
-
서빙 패턴을 위한 AKS, 관리형 엔드포인트, 배치, 큐
-
-
APIMart 같은 플랫폼에서 이는 더 짧은 대기열, 더 안정적인 응답 시간, 트래픽 급증에 대한 더 나은 대응을 뜻할 수 있습니다
한 줄로 요약해야 한다면: Azure는 더 많은 랙 수준 GPU 용량을 추가해 AI 팀이 더 적은 지연과 더 나은 비용 통제로 더 많은 멀티모달 요청을 처리할 수 있도록 합니다.
가장 중요한 것은 하드웨어 이름이 아닙니다. 팀이 워크로드를 올바른 Azure 경로에 어떻게 매핑하고 지연, 대기열 깊이, 동시성, 토큰당 비용을 어떻게 추적하는가입니다.
Helios Is AMD's First AI System To Rival Nvidia Vera Rubin - We Got An Exclusive, First Look
Microsoft가 배포하는 것: Azure의 AMD Helios 랙 시스템

Microsoft는 컴퓨트, 네트워킹, 스토리지를 하나의 설계로 결합한 긴밀하게 통합된 랙 스케일 시스템으로서 AMD Helios를 Azure에 출시하고 있습니다.
이것이 중요한 이유는 노드 간 트래픽을 줄이고 대규모에서 대형 모델 추론을 안정적으로 유지하는 데 도움이 되기 때문입니다. Azure에서 Microsoft는 AI 파이프라인의 각기 다른 부분에 맞게 조정된 ND 시리즈 VM을 통해 이 구성을 제공합니다.
Helios 하드웨어 및 소프트웨어 스택
Helios의 핵심에는 AMD Instinct MI455X GPU가 있습니다. 이는 192 GB의 HBM3 메모리를 갖추고 있으며, 이는 이전 세대보다 1.5배 더 많은 것으로, LLM 및 멀티모달 워크로드를 위한 더 많은 공간을 제공합니다 [2].
AMD EPYC Venice CPU는 전처리와 입력 공급을 담당합니다. 이는 GPU 계층의 부담을 덜어 그것이 병목으로 변하지 않도록 합니다.
네트워킹의 경우, Helios는 InfiniBand와 함께 AMD Pensando DPU를 사용합니다. 목표는 간단합니다: 고동시성 추론과 분산 워크로드를 위한 낮은 지연과 높은 대역폭입니다.
소프트웨어 측면에서는 ROCm **6+**가 FlashAttention, HIPGraph, vLLM 지원을 추가합니다. AMD는 Llama 워크로드를 최대 8배 가속할 수 있다고 밝힙니다 [2]. ROCm은 또한 PyTorch, TensorFlow, DeepSpeed, ONNX 같은 프레임워크와 작동해, Azure의 ND 시리즈 VM 전반에서 모델 이식성을 유지하는 데 도움을 줍니다.
**보안 암호화 가상화(Secure Encrypted Virtualization, SEV)**는 여기에 또 다른 계층을 더합니다. 이는 멀티테넌트 환경에서 AI 모델 가중치와 민감한 멀티모달 데이터를 보호하는 데 도움이 됩니다 [3].
Helios가 Azure AI 인프라에 들어맞는 방식
Azure 내부에서 이 스택은 ND 시리즈 라인업의 일부로 나타납니다.
ND MI455X v7 VM은 Helios 기반 워크로드, 특히 대규모 LLM 추론과 멀티모달 생성에 가장 잘 맞습니다. 그와 함께 ND MI300X v5는 여전히 프로덕션 추론과 학습을 위한 자리를 차지합니다.
추론이 시작되기 전에 일어나는 작업의 경우, Azure는 CPU 중심 시스템을 사용합니다. EPYC 프로세서로 구동되는 HXv2와 HDv2 VM은 데이터 준비, 전처리, HPC 시뮬레이션을 담당합니다.
아래 표는 각 Azure 리소스를 주요 작업에 매핑합니다.
| Azure 리소스 | 주요 하드웨어 | 대상 워크로드 |
|---|---|---|
| ND MI455X v7 | Instinct MI455X (Helios) | LLM 추론, 멀티모달 생성 |
| ND MI300X v5 | Instinct MI300X | 프로덕션 추론, 학습 |
| HXv2 / HDv2 | EPYC Venice CPUs | 전처리, 데이터 준비, HPC 시뮬레이션 |
실제로 팀은 파이프라인의 각 단계를 올바른 Azure 리소스에 맞출 수 있습니다: 전처리는 EPYC 기반 VM에서, 그다음 더 무거운 추론은 MI455X 인스턴스에서 실행합니다.
Azure에서 바뀌는 것: 추론 속도, 규모, 인프라 효율

더 빠른 모델 서빙과 더 낮은 지연의 멀티모달 워크로드
Helios는 실제로 추론을 개선할 때만 의미가 있습니다. 그리고 그것이 바로 이 시스템이 하도록 만들어진 일입니다.
이는 노드 간 지연을 줄여, 여러 GPU에 걸친 분산 추론의 처리량에 도움이 됩니다. 쉽게 말해, 시스템이 더 적은 지연으로 GPU 사이에서 작업을 이동시킬 수 있습니다. 이는 채팅 앱에서 더 빠른 첫 응답으로 이어지고, 비전과 언어가 나란히 작동해야 하는 이미지 및 비디오 작업에서 더 민첩한 성능으로 이어집니다.
그 도약은 클 수 있습니다. 2026년, 특수 하드웨어 설정은 대략 초당 750 토큰에 도달할 수 있으며, 이는 표준 H100 엔드포인트의 초당 100–150 토큰과 대비됩니다 [2]. 프로덕션 추론에서 그 정도의 격차는 사소하지 않습니다. 사용자가 얼마나 빨리 답을 받는지, 시스템이 한 번에 얼마나 많은 요청을 처리할 수 있는지를 바꿀 수 있습니다.
프로덕션 API와 고동시성 추론을 위한 더 많은 용량
지연을 줄이는 바로 그 구성은 또한 Azure가 용량을 더 작고 덜 유용한 조각으로 쪼개지 않으면서 더 많은 동시 요청을 처리하도록 돕습니다.
이는 채팅, 검색, 미디어 파이프라인 전반의 폭발적인 추론 트래픽을 위한 더 많은 여유를 Azure에 줍니다. 요청량이 급증하면 시스템이 이를 따라잡기에 더 나은 위치에 있습니다. 높은 요청 수를 중심으로 구축된 워크로드가 여기서 가장 큰 이득을 보는데, 더 빠른 GPU 인터커넥트가 수요가 커질 때 응답 시간을 안정적으로 유지하는 데 도움이 되기 때문입니다.
랙당, 와트당, 달러당 더 나은 효율
더 높은 처리량은 속도에만 영향을 미치는 것이 아닙니다. 추론의 비용 측면도 바꿉니다.
이 시점에서 효율은 최대 전력에서만이 아니라 작업 수준에서 중요합니다. Helios 같은 랙 스케일 시스템은 그 아이디어를 중심으로 구축되었으며, 이는 Azure가 같은 물리적 공간에서 더 많은 AI 작업을 제공할 수 있음을 뜻합니다.
출력 토큰은 여전히 입력 토큰보다 훨씬 많은 비용이 들기 때문에, 처리량 이득은 단위 경제성을 실질적으로 개선할 수 있습니다 [2]. Azure에서 꾸준한 대량 추론을 운영하는 기업에게 그 이점은 워크로드 규모가 커질수록 쌓여갑니다.
기업, 개발자, 그리고 APIMart가 추가된 Azure 추론 용량을 활용하는 방법

Azure 워크로드를 위한 엔터프라이즈 배포 패턴
여기서의 이점은 각 워크로드를 그에 가장 잘 맞는 Azure 서비스와 짝지음으로써 나옵니다. 대형 모델 추론은 ND 시리즈 GPU 인스턴스에 속합니다. 전처리와 트랜스코딩은 HDv2 또는 HXv2에 맞습니다. 그리고 프로덕션 서빙은 관리형 엔드포인트나 AKS에서 잘 작동합니다. 그 분할은 서류상 깔끔한 것에 그치지 않습니다. 분산된 Azure 배포 전반에서도 잘 작동합니다.
Wayve는 Azure Machine Learning과 AKS를 사용해 선형 확장과 빠른 GPU 인터커넥트로 분산 딥러닝을 확장했습니다 [1]. 그 동일한 구성은 안정적인 지연과 성장 여지가 필요한 실시간 API, RAG 시스템, 멀티모달 파이프라인을 구축하는 개발자에게도 작동할 수 있습니다.
다만 속도는 이야기의 일부일 뿐입니다. 배포 선택은 또한 데이터 상주와 보안 요구를 반영해야 합니다. 팀에 엄격한 상주 또는 보안 규칙이 있다면, Azure AI Foundry가 배포 통제를 한곳에 두고, Confidential Computing이 민감한 AI 워크로드를 위한 하드웨어 기반 암호화를 더합니다 [1].
더 강력한 Azure 추론에서의 APIMart 사용 사례
API 플랫폼의 경우, 더 많은 용량은 대개 사람들이 가장 먼저 체감하는 지표에서 나타납니다: 더 안정적인 지연과 더 짧은 대기열입니다. APIMart는 하나의 통합 API를 통해 사용자에게 500개 이상의 AI 모델에 대한 접근을 제공하므로, 추가된 Azure 추론 용량이 텍스트, 이미지, 비디오 워크로드 전반의 처리량을 끌어올릴 수 있습니다. 이는 대기열 깊이와 지연이 사용자 경험을 매분 좌우하는 프로덕션 도구에서 가장 중요합니다.
MiniMax Hailuo **2.3 ($0.025/sec)**와 Sora 2 Preview ($0.08/sec) 같은 비디오 생성 작업의 경우, 더 높은 처리량이 대기 시간을 줄이고 트래픽 급증 중에도 작업을 계속 진행시킬 수 있습니다. 그리고 더 큰 모델 서빙 워크로드의 경우, 고메모리 GPU 인스턴스가 더 큰 모델과 더 많은 동시 요청을 위한 여유를 팀에 제공합니다.
표: Azure 리소스를 워크로드 유형에 매칭하기
APIMart 스타일의 워크로드의 경우, 주요 패턴은 API 서빙, 큐 기반 생성, 배치 파이프라인입니다. 아래는 그 패턴들이 그에 가장 잘 맞는 Azure 서비스와 어떻게 정렬되는지 보여줍니다.
| Azure 리소스 / 패턴 | 최적 워크로드 | 주요 이점 |
|---|---|---|
| Managed Endpoints (Azure AI Foundry) | 실시간 API, 챗봇, 프로덕션 API | 중앙화된 보안 및 데이터 상주 통제 [4] |
| AKS (Kubernetes) | 에이전트 추론, 마이크로서비스, RAG | 부하 상황에서의 지연 |
| Batch API | 데이터 파이프라인, 비디오 분석, 요약 | 완료 작업당 비용 |
| Event-Driven Queues | 비디오/이미지 생성, 멀티모달 파이프라인 | 성공률과 대기열 깊이 |
결론: 이 Azure 배포가 2026년 AI 팀에 의미하는 것
Microsoft의 Azure AMD Helios 출시는 클라우드 인프라가 어디로 향하는지 보여줍니다: 대량, 저지연 추론이 이제 핵심 스택의 일부입니다.
그것은 팀이 각 워크로드를 올바른 Azure 경로로 보낼 때만 도움이 됩니다. Helios는 팀이 전처리, 서빙, 배치 작업을 올바른 리소스 전반에 나눌 수 있는 더 많은 여유를 줍니다 - 대형 모델을 위한 GPU 인스턴스, 전처리를 위한 하이브리드 경로, 경량 작업을 위한 CPU 전용 경로. 핵심은 간단합니다: 대기열 깊이, 지연, 토큰당 비용을 지켜보세요.
APIMart 사용자에게 그 아키텍처 전환은 실질적인 방식으로 나타납니다. 처리량이 부하 상황에서 더 안정적으로 유지됩니다. 쉽게 말해, APIMart는 트래픽 급증 중에도 텍스트, 이미지, 비디오 워크로드를 더 매끄럽게 계속 진행시킬 수 있습니다.
그 이득은 단위 비용까지 낮출 때 더욱 중요해집니다. 대규모에서 더 나은 효율은 줄당 더 많은 토큰과 더 낮은 작업 수준 비용으로 나타나야 합니다.
종합하면, 이는 더 프로덕션에 적합한 Azure 추론 스택을 가리킵니다. Helios는 간단한 아이디어를 강화합니다: AI 추론은 인프라입니다. 지금 비동기 큐, 스트리밍, 대기열 깊이를 대비하는 팀은 2026년 남은 기간 동안 추론 용량이 계속 성장할 때 더 강력한 위치에 있을 것입니다.
FAQs
제 워크로드에 ND MI455X v7이 필요한지 어떻게 알 수 있나요?
AI 워크로드가 대규모 추론, 특히 대규모 언어 모델과 복잡한 멀티모달 파이프라인을 위해 GPU 가속 인프라를 필요로 한다면 ND MI455X v7 시리즈를 고려하세요.
다음과 같은 상황을 다룰 때 잘 맞습니다:
-
대형 모델 파라미터를 위한 높은 메모리 요구
-
고동시성 또는 지연에 민감한 프로덕션 API
-
비디오 또는 이미지 추론 워크로드
Helios가 실제로 제 Azure 추론 비용을 낮춰줄까요?
예. Azure의 AMD Helios 랙 시스템은 인프라 효율과 확장성을 개선하기 위한 것으로, 이는 실제로 추론 비용을 낮추는 데 도움이 될 수 있습니다.
쉽게 말해: 더 나은 하드웨어는 같은 공간에서 더 많은 작업을 할 수 있습니다. 이는 더 스마트한 리소스 사용을 통해 더 강한 성능 대 비용 비율, 더 빠른 모델 서빙, 프로덕션 API를 위한 더 많은 용량으로 이어질 수 있습니다.
실시간 대 배치 AI에는 어떤 Azure 서비스가 가장 좋나요?
실시간 AI의 경우, 모델을 애플리케이션에 직접 연결해 지연을 낮게 유지하세요. 그 구성은 음성 에이전트와 500밀리초 미만의 응답이 필요한 기타 대화형 사용 사례에 가장 잘 작동합니다.
배치 AI의 경우, 큐, 태스크 ID, 웹훅이 있는 비동기 파이프라인을 사용하세요. 이 방식은 결과가 즉시 돌아올 필요가 없는 미디어 생성 같은 더 긴 작업에 맞습니다. 폭발적인 작업에는 서버리스 함수를, 더 복잡한 다단계 흐름에는 마이크로서비스를 사용하세요.
모델 마켓에서 원하는 모델을 선택하세요
APIMart 모델 마켓에서 채팅, 이미지, 비디오 모델을 사용해 보고 하나의 통합 API로 모델 기능을 빠르게 경험하세요.