
API Qwen-Audio-3.0-TTS: цены и управление голосом
Qwen-Audio-3.0-TTS тарифицируется за миллион входных символов с лимитом 4096 символов. Сравните уровни Flash и Plus, задайте голос, язык и скорость и протестируйте коды ошибок.
Если вы планируете использовать Qwen-Audio-3.0-TTS, первыми важны два числа: цена за 1 000 000 входных символов и лимит в 4096 символов на запрос. Я бы делал выбор настройки на основе этого, а затем зафиксировал voice, language, speed, response_format и instruct для стабильного вывода.
Вот краткая версия:
- Тарификация основана на символах, и учитывается только текст в поле
input. - И Flash, и Plus тарифицируются за 1 000 000 символов.
- Пример тарифа в статье использует $15.00 за 1 млн символов.
- Каждый запрос ограничен 4096 символами.
- Вы можете управлять выводом с помощью:
voiceдля выбора диктораlanguageдля произношенияspeedот 0.5 до 2.0response_format, напримерmp3,wav,opusилиpcminstructдля тона, настроения и подачи
- Модель включает 9 предустановленных дикторов и поддерживает 10 языков.
- Flash подходит для низкой задержки и высокого объёма работы.
- Plus подходит для повествования, брендового голоса и более длинного аудио.
Несколько чисел показывают, насколько низкими могут быть стартовые расходы. При $15.00 за 1 000 000 символов 500 символов x 30 000 запросов составляет примерно $0.225/месяц в примере расчёта из статьи. Это означает, что ваша основная задача — не столько сама цена, сколько поддержание стабильных настроек голоса в разных сценариях.
Я бы читал это руководство как чек-лист настройки: оцените стоимость, выберите диктора, задайте базовые параметры управления, протестируйте коды ошибок вроде 413 и 429, а затем запускайте.

Цены и тарификация Qwen-Audio-3.0-TTS

Qwen-Audio-3.0-TTS тарифицируется по символам входного текста[1].
Как работают единицы тарификации
Оба уровня модели — Flash и Plus — тарифицируются за 1 000 000 символов входного текста. Тарифицируется только текст внутри поля input[1]. Каждый запрос может включать до 4096 символов[1].
Flash хорошо работает для задач с низкой задержкой и высоким объёмом. Plus лучше подходит для повествования и брендовой голосовой работы.
Как оценить ваши ежемесячные расходы
Расчёт довольно прост: возьмите среднее число символов на запрос, умножьте его на ваш месячный объём запросов, разделите на 1 000 000, а затем умножьте на тариф за миллион.
Используя пример цены $15.00 за 1 млн символов, вот как это может выглядеть:
| Сценарий | Ср. символов/запрос | Запросов в месяц | Оценка стоимости в месяц |
|---|---|---|---|
| Чат-ассистент | 500 | 30,000 | ~$0.225 |
| Поддержка клиентов | 1,200 | 30,000 | ~$0.54 |
| Озвучка видео | 10,000 | 30,000 | ~$4.50 |
Короткие ответы обычно стоят очень мало. Более длинное повествование накапливается быстрее.
Как работает тарификация APIMart в мультимодельных проектах

Если ваш рабочий процесс использует более одной модели, измеряйте каждую по её собственной единице тарификации.
В проектах APIMart, которые смешивают аудио, текст, изображения или видео, отслеживайте каждую модель отдельно. Для TTS отслеживайте символы. Для текстовых моделей отслеживайте токены. Для моделей изображений отслеживайте вызовы. Для видеомоделей отслеживайте секунды.
Когда стоимость определена, следующий шаг — выбор параметров управления голосом, которые формируют вывод.
Управление голосом в Qwen-Audio-3.0-TTS
Теперь, когда цены понятны, следующий шаг — формирование голоса.
Qwen-Audio-3.0-TTS разделяет управление голосом на две части. Структурированные параметры отвечают за базовую настройку, а instruct отвечает за стиль. Если вам нужен воспроизводимый вывод, опирайтесь на структурированные поля. Если вы хотите, чтобы тон или эмоция менялись, используйте instruct.
Диктор, язык и формат вывода
API поставляется с 9 предопределёнными профилями дикторов, каждый со своим тембром и голосовым стилем [2]. Для англоязычных приложений Ryan и Aiden — лучший выбор для англоязычного контента. Если вы создаёте продукт для нескольких рынков, параметр language принимает значения вроде English, Chinese или Auto для автоматического определения среди 10 поддерживаемых языков [2].
| Диктор | Описание голоса | Родной язык |
|---|---|---|
| Ryan | Динамичный мужской, сильный ритмический драйв | Английский |
| Aiden | Солнечный американский мужской, чёткий средний регистр | Английский |
| Vivian | Яркая, слегка резковатая молодая женщина | Китайский |
| Serena | Тёплая, мягкая молодая женщина | Китайский |
| Uncle_Fu | Зрелый мужской, низкий мягкий тембр | Китайский |
| Dylan | Юный мужской, пекинский диалект | Китайский |
| Eric | Живой мужской, сычуаньский диалект | Китайский |
| Ono_Anna | Игривый женский, лёгкий проворный тембр | Японский |
| Sohee | Тёплый женский, богатая эмоция | Корейский |
Здесь хорошо работает простое правило: подбирайте диктора под целевой язык. Для контента на en-US обычно наиболее уместны Ryan или Aiden [2].
Для вывода вы можете выбрать mp3, wav, opus или pcm. Стандартные форматы вроде MP3 и WAV хорошо работают в современных браузерах и медиа-инструментах [1][2].
Тон, скорость и эмоция
Параметр speed принимает числовой диапазон от 0.5 до 2.0, где 1.0 — значение по умолчанию [2]. Документированные средства управления в этой области — speed и instruct, которые влияют на эмоцию, тембр, просодию и тон [2].
| Управление | Поле запроса | Ожидаемые значения / диапазон | Аудио-эффект | Наиболее подходящий сценарий |
|---|---|---|---|---|
| Диктор | speaker | Vivian, Ryan, Aiden и т.д. | Задаёт базовый тембр и родной акцент | Брендовые персонажи, локализованный контент |
| Язык | language | English, Chinese, Auto и т.д. | Определяет произношение и локаль | Многоязычные приложения |
| Скорость | speed | 0.5–2.0 (по умолчанию: 1.0) | Изменяет темп речи | Образовательный контент, быстрые дисклеймеры |
| Эмоция/Тон | instruct | Very happy, Angry, Calm, Incredulous | Смещает просодию и эмоциональную подачу | Маркетинг, игровые персонажи, поддержка |
| Формат | response_format | wav, mp3, pcm, opus | Влияет на размер файла и совместимость | Воспроизведение в браузере и медиа-инструменты |
Одну деталь стоит держать в поле зрения: если instruct требует возбуждённой подачи, темп может ускориться, даже когда speed: 1.0 остаётся неизменным [2]. Так что если чтение кажется быстрее ожидаемого, причиной может быть стилевой промпт.
Структурированные параметры против промпт-инструкций
Полезно думать о явных полях — speaker, language, speed и response_format — как о вашей производственной базе. Они задают основную идентичность голоса для каждого запроса. Затем instruct располагается поверх этого базового слоя и формирует то, как голос исполняет [2].
Используйте структурированные параметры, когда вам нужен стабильный производственный вывод. Используйте instruct, когда хотите вариативности. На практике более описательные промпты обычно дают более нюансированные результаты, чем инструкции из одного слова [2].
Эти значения по умолчанию напрямую переносятся в тело запроса в следующем разделе.
Как отправлять запросы Qwen-Audio-3.0-TTS через APIMart
Отправляйте POST-запросы на https://api.apimart.ai/v1/audio/speech и передавайте ваш Bearer-токен в заголовке Authorization [1].
Базовая структура запроса
Основные поля — model, input, voice, language, response_format, speed и instruct [1][2]. Также держите input в пределах 4096 символов.
Этот запрос помещает фактор цены и настройки голоса в одно тело:
{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Welcome to our platform. We are excited to have you here.",
"voice": "Aiden",
"language": "English",
"instruct": "Warm and welcoming tone",
"response_format": "mp3",
"speed": 1.0
}
Проще говоря, эти поля сообщают API, что сказать, как это сказать и какой формат вернуть.
Для быстрого теста cURL используйте:
curl --request POST \
--url https://api.apimart.ai/v1/audio/speech \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Your order has been confirmed and will ship shortly.",
"voice": "Serena",
"language": "English",
"response_format": "opus"
}' \
--output confirmation.opus
Это сохраняет аудио-ответ прямо в confirmation.opus [1].
Рекомендуемые настройки для распространённых сценариев
Когда вы знаете форму запроса, выбор настроек становится намного проще. Таблица ниже сопоставляет распространённые сценарии с хорошим стартовым пресетом.
| Сценарий | Рекомендуемый уровень | voice | Скорость | Промпт instruct | Чувствительность к стоимости |
|---|---|---|---|---|---|
| Поддержка клиентов | Flash (0.6B) | Serena | 1.1 | Helpful | Высокая |
| Онбординг приложения | Plus (1.7B) | Aiden | 1.0 | Warm and welcoming | Средняя |
| Образовательное повествование | Plus (1.7B) | Uncle_Fu | 0.9 | Authoritative and measured | Средняя |
| Рекламный креатив | Plus (1.7B) | Vivian | 1.0 | Energetic and dynamic | Низкая |
| Озвучка видео о продукте | Plus (1.7B) | Ryan | 1.0 | Professional and clear | Низкая |
Если вам нужен многоязычный вывод, задайте language в соответствии с вашим сценарием. Модель поддерживает 10 основных языков: китайский, английский, японский, корейский, немецкий, французский, русский, португальский, испанский и итальянский [2].
Лимиты запросов, ошибки и проверки для продакшена
Прежде чем переходить в продакшен, намеренно протестируйте несколько случаев сбоя. Это один из тех небольших шагов, которые могут избавить от больших проблем позже.
| Код ошибки | Значение | Рекомендуемое действие |
|---|---|---|
| 400 | Неверные параметры | Проверьте структуру JSON и допустимые значения |
| 401 | Отсутствует или неверный API-ключ | Проверьте ваш Bearer-токен |
| 402 | Недостаточный баланс аккаунта | Пополните ваш аккаунт APIMart |
| 413 | Ввод превышает 4096 символов | Разбейте текст на меньшие сегменты |
| 429 | Превышен лимит запросов | Повторите с экспоненциальной задержкой |
| 500/502 | Ошибка сервера или шлюза | Немного подождите, затем повторите |
400 обычно означает, что что-то в теле запроса не так. 413 более прямолинеен: ваш текст слишком длинный, поэтому разбейте его на меньшие части. А если вы получили 429, отступите и повторите, вместо того чтобы долбить эндпоинт.
Выбор правильной настройки и следующие шаги
Простая схема принятия решений
Теперь, когда цены и управление голосом заданы, используйте этот последний фильтр, чтобы сопоставить модель с нужной вам работой.
Выбирайте на основе бюджета, управления голосом и сценария использования.
| Приоритет | Наилучшее соответствие | Рекомендуемый уровень |
|---|---|---|
| Низкая задержка и высокий объём | Живые ассистенты, IVR, перевод в реальном времени | Flash |
| Экономичность при высоком объёме | Массовая локализация, объёмная поддержка клиентов | Flash |
| Выразительное брендовое повествование | Брендовое повествование, длинное аудио, голоса персонажей | Plus |
Если вы делаете длинное повествование, придерживайтесь одного диктора от начала до конца. Держите instruct кратким, простым и воспроизводимым. Это обычно даёт более стабильный вывод и меньше сюрпризов.
Для более простых настроек держите всё ещё чище: выберите одного диктора и меняйте только поле instruct, когда нужно.
Ключевые моменты для внедрения
Как только вы выбрали уровень, настройте всё вокруг сценария, который будете запускать чаще всего. Это держит ваш план запуска привязанным к реальному использованию, а не к крайним случаям.
- Настройте оповещения об использовании до запуска.
- Проверьте каждый сценарий с его собственным диктором, скоростью и промптом
instruct. - Протестируйте вывод на носителях американского английского до запуска.
- APIMart позволяет переключать уровни без изменения основного паттерна интеграции.
Также протестируйте, как ваша система обрабатывает 402, 429 и 502 до запуска.
Часто задаваемые вопросы
Как разбить длинный текст свыше 4096 символов?
Разбейте текст на части по 4096 символов или меньше и отправьте каждую часть в API отдельно.
Старайтесь разбивать в естественных точках остановки, например в конце предложения или абзаца. После этого объедините возвращённые аудиофайлы в одну финальную дорожку.
Какие настройки голоса зафиксировать для стабильного вывода?
Для стабильного длинного вывода используйте модель VoiceDesign, чтобы задать чёткую персону и референсный клип. Затем создайте переиспользуемый промпт с помощью create_voice_clone_prompt и передайте этот voice_clone_prompt в generate_voice_clone.
Также помогает зафиксировать настройки генерации, такие как top_p, чтобы голос не дрейфовал со временем. И перед запуском сделайте пробный прогон, чтобы поймать проблемы заранее.
Когда выбирать Flash вместо Plus?
Выбирайте Flash (0.6B), когда скорость и низкая задержка важнее всего. Он создан для сценариев с высокой конкурентностью, таких как виртуальные ассистенты в реальном времени, живой перевод и поддержка клиентов, где критично быстрое время отклика.
Выбирайте Plus (1.7B), когда качество и точность важнее скорости. Он обеспечивает лучшую просодию, более широкий эмоциональный диапазон и более высокую точность для аудиокниг, профессиональной озвучки и брендовых медиа.
Выберите нужную модель в маркетплейсе моделей
Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.