
Microsoft добавляет AMD Helios в инференс Azure AI
Microsoft развёртывает стоечные системы AMD Helios (ND MI455X, 192 ГБ HBM3) в Azure для роста пропускной способности инференса ИИ, снижения задержки и стоимости в масштабе.
Microsoft добавляет системы AMD Helios в Azure, чтобы сделать инференс ИИ быстрее, стабильнее и дешевле в масштабе. Если вы запускаете нагрузки чата, изображений или видео, короткая версия проста: больше пропускной способности, меньше задержки и больше запаса для высокого объёма запросов.
Вот что я бы вынес прямо сейчас:
-
Helios нацелен на продакшен-инференс, а не только на лабораторное тестирование
-
VM ND MI455X v7 — основной вариант Azure для крупных задач LLM и мультимодальных задач
-
192 ГБ памяти HBM3 на MI455X даёт больше места для крупных моделей
-
AMD заявляет, что некоторые нагрузки Llama могут дать прирост до 8x
-
Статья указывает на ~750 токенов/сек на специализированных конфигурациях против ~100–150 токенов/сек на стандартных эндпоинтах H100
-
Azure по-прежнему распределяет работу по стеку:
-
CPU VM для подготовительной работы
-
GPU VM для тяжёлого инференса
-
AKS, управляемые эндпоинты, пакетная обработка и очереди для паттернов обслуживания
-
-
Для платформ вроде APIMart это может означать более короткие очереди, более стабильное время отклика и лучшую обработку всплесков трафика
Если бы мне пришлось подвести итог одной строкой: Azure добавляет больше стоечных GPU-мощностей, чтобы ИИ-команды могли обслуживать больше мультимодальных запросов с меньшей задержкой и лучшим контролем стоимости.
Важнее всего не название оборудования. Важно то, как команды сопоставляют нагрузки с правильным путём Azure и отслеживают задержку, глубину очереди, параллельность и стоимость за токен.
Helios — первая ИИ-система AMD, способная соперничать с Nvidia Vera Rubin — мы получили эксклюзивный первый взгляд
Что развёртывает Microsoft: стоечные системы AMD Helios в Azure

Microsoft разворачивает AMD Helios в Azure как плотно интегрированную систему стоечного масштаба, которая объединяет вычисления, сеть и хранилище в одном дизайне.
Это важно, потому что сокращает трафик между узлами и помогает поддерживать инференс крупных моделей стабильным в масштабе. В Azure Microsoft предоставляет эту конфигурацию через VM серии ND, настроенные под разные части ИИ-конвейера.
Аппаратный и программный стек Helios
В основе Helios лежит GPU AMD Instinct MI455X. Он поставляется с 192 ГБ памяти HBM3, что в 1.5 раза больше, чем у предыдущих поколений, давая больше места для нагрузок LLM и мультимодальных нагрузок [2].
CPU AMD EPYC Venice занимаются предобработкой и подачей входных данных. Это снимает нагрузку со слоя GPU, чтобы он не превращался в узкое место.
Для сети Helios использует DPU AMD Pensando с InfiniBand. Цель проста: низкая задержка и высокая пропускная способность для инференса с высокой параллельностью и распределённых нагрузок.
С программной стороны ROCm 6+ добавляет поддержку FlashAttention, HIPGraph и vLLM. AMD заявляет, что может ускорить нагрузки Llama до 8x [2]. ROCm также работает с фреймворками вроде PyTorch, TensorFlow, DeepSpeed и ONNX, что помогает сохранять переносимость моделей между VM серии ND в Azure.
Secure Encrypted Virtualization (SEV) добавляет здесь ещё один слой. Она помогает защитить веса ИИ-моделей и чувствительные мультимодальные данные в мультитенантных средах [3].
Как Helios вписывается в инфраструктуру Azure AI
Внутри Azure этот стек появляется как часть линейки серии ND.
VM ND MI455X v7 — основной вариант для нагрузок на базе Helios, особенно крупномасштабного инференса LLM и мультимодальной генерации. Наряду с ними ND MI300X v5 по-прежнему находит место для продакшен-инференса и обучения.
Для работы, которая происходит до начала инференса, Azure использует системы, ориентированные на CPU. VM HXv2 и HDv2 на базе процессоров EPYC занимаются подготовкой данных, предобработкой и HPC-симуляциями.
Таблица ниже сопоставляет каждый ресурс Azure с его основной задачей.
| Ресурс Azure | Основное оборудование | Целевая нагрузка |
|---|---|---|
| ND MI455X v7 | Instinct MI455X (Helios) | Инференс LLM, мультимодальная генерация |
| ND MI300X v5 | Instinct MI300X | Продакшен-инференс, обучение |
| HXv2 / HDv2 | CPU EPYC Venice | Предобработка, подготовка данных, HPC-симуляции |
На практике команды могут выстроить каждый этап конвейера с правильным ресурсом Azure: предобработка на VM на базе EPYC, затем более тяжёлый инференс на инстансах MI455X.
Что меняется в Azure: скорость инференса, масштаб и эффективность инфраструктуры

Более быстрое обслуживание моделей и мультимодальные нагрузки с меньшей задержкой
Helios важен только если он делает инференс лучше на практике. И именно для этого он создан.
Он сокращает задержку между узлами, что помогает пропускной способности для распределённого инференса на нескольких GPU. Проще говоря, система может перемещать работу между GPU с меньшей задержкой. Это ведёт к более быстрым первым ответам в чат-приложениях и более отзывчивой производительности для задач с изображениями и видео, где зрение и язык должны работать бок о бок.
Скачок может быть большим. В 2026 году специализированные аппаратные конфигурации могут достигать примерно 750 токенов в секунду против 100–150 токенов в секунду на стандартных эндпоинтах H100 [2]. В продакшен-инференсе такой разрыв не мелочь. Он может изменить, насколько быстро пользователи получают ответы и сколько запросов система может обработать одновременно.
Больше мощности для продакшен-API и инференса с высокой параллельностью
Та же конфигурация, что сокращает задержку, помогает Azure обрабатывать больше параллельных запросов, не дробя мощность на более мелкие, менее полезные части.
Это даёт Azure больше запаса для всплескового инференс-трафика в конвейерах чата, поиска и медиа. Если объём запросов резко возрастает, система находится в лучшем положении, чтобы справиться. Нагрузки, построенные вокруг высокого числа запросов, выигрывают здесь больше всего, поскольку более быстрые GPU-соединения помогают поддерживать стабильное время отклика по мере роста спроса.
Лучшая эффективность на стойку, на ватт и на доллар
Более высокая пропускная способность влияет не только на скорость. Она меняет и сторону стоимости инференса.
На этом этапе эффективность важна на уровне задачи, а не только на пиковой мощности. Системы стоечного масштаба вроде Helios построены вокруг этой идеи, что означает, что Azure может выдавать больше ИИ-работы с того же физического пространства.
Выходные токены по-прежнему стоят гораздо больше входных, поэтому прирост пропускной способности может существенно улучшить юнит-экономику [2]. Для предприятий, запускающих стабильный, высокообъёмный инференс в Azure, это преимущество накапливается по мере роста размера нагрузки.
Как предприятия, разработчики и APIMart могут использовать добавленную мощность инференса Azure

Паттерны корпоративного развёртывания для нагрузок Azure
Выгода здесь исходит из сопоставления каждой нагрузки с сервисом Azure, который подходит ей лучше всего. Инференс крупных моделей относится к GPU-инстансам серии ND. Предобработка и транскодирование подходят для HDv2 или HXv2. А продакшен-обслуживание хорошо работает на управляемых эндпоинтах или AKS. Это разделение не просто аккуратно на бумаге. Оно также хорошо работает в распределённых развёртываниях Azure.
Wayve использовала Azure Machine Learning и AKS, чтобы масштабировать распределённое глубокое обучение с линейным масштабированием и быстрыми GPU-соединениями [1]. Та же конфигурация может работать для разработчиков, создающих API реального времени, RAG-системы и мультимодальные конвейеры, которым нужны стабильная задержка и запас для роста.
Впрочем, скорость — лишь часть истории. Выбор развёртывания также должен отражать требования к резидентности и безопасности. Если у команды строгие правила резидентности или безопасности, Azure AI Foundry собирает средства управления развёртыванием в одном месте, а Confidential Computing добавляет аппаратное шифрование для чувствительных ИИ-нагрузок [1].
Сценарии использования APIMart на более мощном инференсе Azure
Для API-платформ больше мощности обычно проявляется в метриках, которые люди чувствуют первыми: более стабильная задержка и более короткие очереди. APIMart даёт пользователям доступ к более чем 500 ИИ-моделям через один унифицированный API, поэтому добавленная мощность инференса Azure может повысить пропускную способность в текстовых, графических и видеонагрузках. Это важнее всего в продакшен-инструментах, где глубина очереди и задержка формируют пользовательский опыт минута за минутой.
Для задач генерации видео вроде MiniMax Hailuo 2.3 ($0.025/sec) и Sora 2 Preview ($0.08/sec) более высокая пропускная способность может сократить время в очереди и поддерживать движение задач во время всплесков трафика. А для более крупных нагрузок обслуживания моделей GPU-инстансы с большой памятью дают командам больше запаса для более крупных моделей и большего числа параллельных запросов.
Таблица: сопоставление ресурсов Azure с типами нагрузок
Для нагрузок в стиле APIMart основные паттерны — это обслуживание API, генерация через очередь и пакетные конвейеры. Вот как эти паттерны выстраиваются с сервисами Azure, которые подходят им лучше всего.
| Ресурс / паттерн Azure | Наиболее подходящая нагрузка | Основное преимущество |
|---|---|---|
| Управляемые эндпоинты (Azure AI Foundry) | API реального времени, чат-боты, продакшен-API | Централизованный контроль безопасности и резидентности данных [4] |
| AKS (Kubernetes) | Агентное рассуждение, микросервисы, RAG | Задержка под нагрузкой |
| Batch API | Конвейеры данных, анализ видео, суммаризация | Стоимость за завершённую задачу |
| Очереди на основе событий | Генерация видео/изображений, мультимодальные конвейеры | Уровень успеха и глубина очереди |
Заключение: что это развёртывание Azure значит для ИИ-команд в 2026 году
Развёртывание AMD Helios в Azure от Microsoft показывает, куда движется облачная инфраструктура: высокообъёмный инференс с низкой задержкой теперь часть основного стека.
Это помогает только если команды направляют каждую нагрузку по правильному пути Azure. Helios даёт командам больше запаса, чтобы распределить предобработку, обслуживание и пакетную работу по правильным ресурсам — GPU-инстансы для крупных моделей, гибридные пути для предобработки и только-CPU пути для лёгких задач. Ключ прост: следите за глубиной очереди, задержкой и стоимостью за токен.
Для пользователей APIMart этот архитектурный сдвиг проявляется практическим образом. Пропускная способность остаётся стабильнее под нагрузкой. Проще говоря, APIMart может поддерживать более плавное движение текстовых, графических и видеонагрузок во время всплесков трафика.
Эти достижения важны ещё больше, когда они также снижают юнит-стоимость. В масштабе лучшая эффективность должна проявляться как больше токенов на джоуль и меньшая стоимость на уровне задачи.
В совокупности это указывает на более готовый к продакшену стек инференса Azure. Helios подкрепляет простую мысль: инференс ИИ — это инфраструктура. Команды, которые планируют асинхронные очереди, стриминг и глубину очереди сейчас, будут в более сильном положении по мере того, как мощность инференса продолжает расти до конца 2026 года.
Частые вопросы
Как понять, нужен ли моей нагрузке ND MI455X v7?
Рассмотрите серию ND MI455X v7, если вашей ИИ-нагрузке нужна инфраструктура с GPU-ускорением для крупномасштабного инференса, особенно для больших языковых моделей и сложных мультимодальных конвейеров.
Это сильный выбор, когда вы имеете дело с:
-
высокими требованиями к памяти для больших параметров модели
-
продакшен-API с высокой параллельностью или чувствительностью к задержке
-
нагрузками инференса видео или изображений
Снизит ли Helios мои затраты на инференс в Azure на практике?
Да. Стоечные системы AMD Helios в Azure предназначены для улучшения эффективности инфраструктуры и масштабируемости, что может помочь снизить затраты на инференс на практике.
Проще говоря: лучшее оборудование может выполнять больше работы с тем же пространством. Это может привести к более сильному соотношению производительности к стоимости, более быстрому обслуживанию моделей и большей мощности для продакшен-API за счёт более умного использования ресурсов.
Какой сервис Azure лучше для реального времени против пакетного ИИ?
Для ИИ реального времени подключайте модель напрямую к приложению, чтобы поддерживать низкую задержку. Такая конфигурация лучше всего подходит для голосовых агентов и других интерактивных сценариев, которым нужны ответы менее чем за 500 миллисекунд.
Для пакетного ИИ используйте асинхронные конвейеры с очередями, идентификаторами задач и вебхуками. Этот подход подходит для более длинных задач вроде генерации медиа, где результат не нужен сразу. Используйте бессерверные функции для всплесковых действий и микросервисы для более сложных, многошаговых процессов.
Выберите нужную модель в маркетплейсе моделей
Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.