APIMart
API Qwen-Audio-3.0-TTS: цены и управление голосом

API Qwen-Audio-3.0-TTS: цены и управление голосом

Qwen-Audio-3.0-TTS тарифицируется за миллион входных символов с лимитом 4096 символов. Сравните уровни Flash и Plus, задайте голос, язык и скорость и протестируйте коды ошибок.

Туториал

Если вы планируете использовать Qwen-Audio-3.0-TTS, первыми важны два числа: цена за 1 000 000 входных символов и лимит в 4096 символов на запрос. Я бы делал выбор настройки на основе этого, а затем зафиксировал voice, language, speed, response_format и instruct для стабильного вывода.

Вот краткая версия:

  • Тарификация основана на символах, и учитывается только текст в поле input.
  • И Flash, и Plus тарифицируются за 1 000 000 символов.
  • Пример тарифа в статье использует $15.00 за 1 млн символов.
  • Каждый запрос ограничен 4096 символами.
  • Вы можете управлять выводом с помощью:
    • voice для выбора диктора
    • language для произношения
    • speed от 0.5 до 2.0
    • response_format, например mp3, wav, opus или pcm
    • instruct для тона, настроения и подачи
  • Модель включает 9 предустановленных дикторов и поддерживает 10 языков.
  • Flash подходит для низкой задержки и высокого объёма работы.
  • Plus подходит для повествования, брендового голоса и более длинного аудио.

Несколько чисел показывают, насколько низкими могут быть стартовые расходы. При $15.00 за 1 000 000 символов 500 символов x 30 000 запросов составляет примерно $0.225/месяц в примере расчёта из статьи. Это означает, что ваша основная задача — не столько сама цена, сколько поддержание стабильных настроек голоса в разных сценариях.

Я бы читал это руководство как чек-лист настройки: оцените стоимость, выберите диктора, задайте базовые параметры управления, протестируйте коды ошибок вроде 413 и 429, а затем запускайте.

Qwen-Audio-3.0-TTS: Flash против Plus – цены, голоса и сценарии с первого взгляда
Qwen-Audio-3.0-TTS: Flash против Plus – цены, голоса и сценарии с первого взгляда

Цены и тарификация Qwen-Audio-3.0-TTS

Qwen-Audio-3.0-TTS

Qwen-Audio-3.0-TTS тарифицируется по символам входного текста[1].

Как работают единицы тарификации

Оба уровня модели — Flash и Plus — тарифицируются за 1 000 000 символов входного текста. Тарифицируется только текст внутри поля input[1]. Каждый запрос может включать до 4096 символов[1].

Flash хорошо работает для задач с низкой задержкой и высоким объёмом. Plus лучше подходит для повествования и брендовой голосовой работы.

Как оценить ваши ежемесячные расходы

Расчёт довольно прост: возьмите среднее число символов на запрос, умножьте его на ваш месячный объём запросов, разделите на 1 000 000, а затем умножьте на тариф за миллион.

Используя пример цены $15.00 за 1 млн символов, вот как это может выглядеть:

СценарийСр. символов/запросЗапросов в месяцОценка стоимости в месяц
Чат-ассистент50030,000~$0.225
Поддержка клиентов1,20030,000~$0.54
Озвучка видео10,00030,000~$4.50

Короткие ответы обычно стоят очень мало. Более длинное повествование накапливается быстрее.

Как работает тарификация APIMart в мультимодельных проектах

GccAi

Если ваш рабочий процесс использует более одной модели, измеряйте каждую по её собственной единице тарификации.

В проектах APIMart, которые смешивают аудио, текст, изображения или видео, отслеживайте каждую модель отдельно. Для TTS отслеживайте символы. Для текстовых моделей отслеживайте токены. Для моделей изображений отслеживайте вызовы. Для видеомоделей отслеживайте секунды.

Когда стоимость определена, следующий шаг — выбор параметров управления голосом, которые формируют вывод.

Управление голосом в Qwen-Audio-3.0-TTS

Теперь, когда цены понятны, следующий шаг — формирование голоса.

Qwen-Audio-3.0-TTS разделяет управление голосом на две части. Структурированные параметры отвечают за базовую настройку, а instruct отвечает за стиль. Если вам нужен воспроизводимый вывод, опирайтесь на структурированные поля. Если вы хотите, чтобы тон или эмоция менялись, используйте instruct.

Диктор, язык и формат вывода

API поставляется с 9 предопределёнными профилями дикторов, каждый со своим тембром и голосовым стилем [2]. Для англоязычных приложений Ryan и Aiden — лучший выбор для англоязычного контента. Если вы создаёте продукт для нескольких рынков, параметр language принимает значения вроде English, Chinese или Auto для автоматического определения среди 10 поддерживаемых языков [2].

ДикторОписание голосаРодной язык
RyanДинамичный мужской, сильный ритмический драйвАнглийский
AidenСолнечный американский мужской, чёткий средний регистрАнглийский
VivianЯркая, слегка резковатая молодая женщинаКитайский
SerenaТёплая, мягкая молодая женщинаКитайский
Uncle_FuЗрелый мужской, низкий мягкий тембрКитайский
DylanЮный мужской, пекинский диалектКитайский
EricЖивой мужской, сычуаньский диалектКитайский
Ono_AnnaИгривый женский, лёгкий проворный тембрЯпонский
SoheeТёплый женский, богатая эмоцияКорейский

Здесь хорошо работает простое правило: подбирайте диктора под целевой язык. Для контента на en-US обычно наиболее уместны Ryan или Aiden [2].

Для вывода вы можете выбрать mp3, wav, opus или pcm. Стандартные форматы вроде MP3 и WAV хорошо работают в современных браузерах и медиа-инструментах [1][2].

Тон, скорость и эмоция

Параметр speed принимает числовой диапазон от 0.5 до 2.0, где 1.0 — значение по умолчанию [2]. Документированные средства управления в этой области — speed и instruct, которые влияют на эмоцию, тембр, просодию и тон [2].

УправлениеПоле запросаОжидаемые значения / диапазонАудио-эффектНаиболее подходящий сценарий
ДикторspeakerVivian, Ryan, Aiden и т.д.Задаёт базовый тембр и родной акцентБрендовые персонажи, локализованный контент
ЯзыкlanguageEnglish, Chinese, Auto и т.д.Определяет произношение и локальМногоязычные приложения
Скоростьspeed0.5–2.0 (по умолчанию: 1.0)Изменяет темп речиОбразовательный контент, быстрые дисклеймеры
Эмоция/ТонinstructVery happy, Angry, Calm, IncredulousСмещает просодию и эмоциональную подачуМаркетинг, игровые персонажи, поддержка
Форматresponse_formatwav, mp3, pcm, opusВлияет на размер файла и совместимостьВоспроизведение в браузере и медиа-инструменты

Одну деталь стоит держать в поле зрения: если instruct требует возбуждённой подачи, темп может ускориться, даже когда speed: 1.0 остаётся неизменным [2]. Так что если чтение кажется быстрее ожидаемого, причиной может быть стилевой промпт.

Структурированные параметры против промпт-инструкций

Полезно думать о явных полях — speaker, language, speed и response_format — как о вашей производственной базе. Они задают основную идентичность голоса для каждого запроса. Затем instruct располагается поверх этого базового слоя и формирует то, как голос исполняет [2].

Используйте структурированные параметры, когда вам нужен стабильный производственный вывод. Используйте instruct, когда хотите вариативности. На практике более описательные промпты обычно дают более нюансированные результаты, чем инструкции из одного слова [2].

Эти значения по умолчанию напрямую переносятся в тело запроса в следующем разделе.

Как отправлять запросы Qwen-Audio-3.0-TTS через APIMart

Отправляйте POST-запросы на https://api.apimart.ai/v1/audio/speech и передавайте ваш Bearer-токен в заголовке Authorization [1].

Базовая структура запроса

Основные поля — model, input, voice, language, response_format, speed и instruct [1][2]. Также держите input в пределах 4096 символов.

Этот запрос помещает фактор цены и настройки голоса в одно тело:

{
  "model": "YOUR_QWEN_MODEL_ID",
  "input": "Welcome to our platform. We are excited to have you here.",
  "voice": "Aiden",
  "language": "English",
  "instruct": "Warm and welcoming tone",
  "response_format": "mp3",
  "speed": 1.0
}

Проще говоря, эти поля сообщают API, что сказать, как это сказать и какой формат вернуть.

Для быстрого теста cURL используйте:

curl --request POST \
  --url https://api.apimart.ai/v1/audio/speech \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "YOUR_QWEN_MODEL_ID",
    "input": "Your order has been confirmed and will ship shortly.",
    "voice": "Serena",
    "language": "English",
    "response_format": "opus"
  }' \
  --output confirmation.opus

Это сохраняет аудио-ответ прямо в confirmation.opus [1].

Рекомендуемые настройки для распространённых сценариев

Когда вы знаете форму запроса, выбор настроек становится намного проще. Таблица ниже сопоставляет распространённые сценарии с хорошим стартовым пресетом.

СценарийРекомендуемый уровеньvoiceСкоростьПромпт instructЧувствительность к стоимости
Поддержка клиентовFlash (0.6B)Serena1.1HelpfulВысокая
Онбординг приложенияPlus (1.7B)Aiden1.0Warm and welcomingСредняя
Образовательное повествованиеPlus (1.7B)Uncle_Fu0.9Authoritative and measuredСредняя
Рекламный креативPlus (1.7B)Vivian1.0Energetic and dynamicНизкая
Озвучка видео о продуктеPlus (1.7B)Ryan1.0Professional and clearНизкая

Если вам нужен многоязычный вывод, задайте language в соответствии с вашим сценарием. Модель поддерживает 10 основных языков: китайский, английский, японский, корейский, немецкий, французский, русский, португальский, испанский и итальянский [2].

Лимиты запросов, ошибки и проверки для продакшена

Прежде чем переходить в продакшен, намеренно протестируйте несколько случаев сбоя. Это один из тех небольших шагов, которые могут избавить от больших проблем позже.

Код ошибкиЗначениеРекомендуемое действие
400Неверные параметрыПроверьте структуру JSON и допустимые значения
401Отсутствует или неверный API-ключПроверьте ваш Bearer-токен
402Недостаточный баланс аккаунтаПополните ваш аккаунт APIMart
413Ввод превышает 4096 символовРазбейте текст на меньшие сегменты
429Превышен лимит запросовПовторите с экспоненциальной задержкой
500/502Ошибка сервера или шлюзаНемного подождите, затем повторите

400 обычно означает, что что-то в теле запроса не так. 413 более прямолинеен: ваш текст слишком длинный, поэтому разбейте его на меньшие части. А если вы получили 429, отступите и повторите, вместо того чтобы долбить эндпоинт.

Выбор правильной настройки и следующие шаги

Простая схема принятия решений

Теперь, когда цены и управление голосом заданы, используйте этот последний фильтр, чтобы сопоставить модель с нужной вам работой.

Выбирайте на основе бюджета, управления голосом и сценария использования.

ПриоритетНаилучшее соответствиеРекомендуемый уровень
Низкая задержка и высокий объёмЖивые ассистенты, IVR, перевод в реальном времениFlash
Экономичность при высоком объёмеМассовая локализация, объёмная поддержка клиентовFlash
Выразительное брендовое повествованиеБрендовое повествование, длинное аудио, голоса персонажейPlus

Если вы делаете длинное повествование, придерживайтесь одного диктора от начала до конца. Держите instruct кратким, простым и воспроизводимым. Это обычно даёт более стабильный вывод и меньше сюрпризов.

Для более простых настроек держите всё ещё чище: выберите одного диктора и меняйте только поле instruct, когда нужно.

Ключевые моменты для внедрения

Как только вы выбрали уровень, настройте всё вокруг сценария, который будете запускать чаще всего. Это держит ваш план запуска привязанным к реальному использованию, а не к крайним случаям.

  • Настройте оповещения об использовании до запуска.
  • Проверьте каждый сценарий с его собственным диктором, скоростью и промптом instruct.
  • Протестируйте вывод на носителях американского английского до запуска.
  • APIMart позволяет переключать уровни без изменения основного паттерна интеграции.

Также протестируйте, как ваша система обрабатывает 402, 429 и 502 до запуска.

Часто задаваемые вопросы

Как разбить длинный текст свыше 4096 символов?

Разбейте текст на части по 4096 символов или меньше и отправьте каждую часть в API отдельно.

Старайтесь разбивать в естественных точках остановки, например в конце предложения или абзаца. После этого объедините возвращённые аудиофайлы в одну финальную дорожку.

Какие настройки голоса зафиксировать для стабильного вывода?

Для стабильного длинного вывода используйте модель VoiceDesign, чтобы задать чёткую персону и референсный клип. Затем создайте переиспользуемый промпт с помощью create_voice_clone_prompt и передайте этот voice_clone_prompt в generate_voice_clone.

Также помогает зафиксировать настройки генерации, такие как top_p, чтобы голос не дрейфовал со временем. И перед запуском сделайте пробный прогон, чтобы поймать проблемы заранее.

Когда выбирать Flash вместо Plus?

Выбирайте Flash (0.6B), когда скорость и низкая задержка важнее всего. Он создан для сценариев с высокой конкурентностью, таких как виртуальные ассистенты в реальном времени, живой перевод и поддержка клиентов, где критично быстрое время отклика.

Выбирайте Plus (1.7B), когда качество и точность важнее скорости. Он обеспечивает лучшую просодию, более широкий эмоциональный диапазон и более высокую точность для аудиокниг, профессиональной озвучки и брендовых медиа.

Готовы попробовать?

Выберите нужную модель в маркетплейсе моделей

Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.

Чат-моделиМодели изображенийВидео-модели
Открыть маркетплейс моделей