APIMart
Qwen-Audio-3.0-TTS API:定价与语音控制

Qwen-Audio-3.0-TTS API:定价与语音控制

Qwen-Audio-3.0-TTS 按每百万输入字符计费,单次请求上限 4,096 字符。对比 Flash 与 Plus 版本,设置语音、语言和语速,并测试错误码。

教程

如果你打算使用 Qwen-Audio-3.0-TTS,有两个数字最先要关注:每 1,000,000 个输入字符的价格每次请求 4,096 字符的上限 我会据此做出配置选择,然后锁定 voicelanguagespeedresponse_formatinstruct 以获得稳定输出。

简短版本如下:

  • 计费按字符计,且只有 input 字段中的文本才计入。
  • Flash 和 Plus 都按每 1,000,000 字符计费。
  • 文中的示例费率使用 每 100 万字符 $15.00
  • 每次请求上限为 4,096 字符
  • 你可以通过以下方式控制输出:
    • voice 选择说话人
    • language 控制发音
    • speed,范围从 0.5 到 2.0
    • response_format,如 mp3wavopuspcm
    • instruct 控制语气、情绪和表达方式
  • 该模型内置 9 个预设说话人并支持 10 种语言
  • Flash 适合低延迟、高并发的工作。
  • Plus 适合旁白、品牌语音和较长篇幅的音频。

几个数字可以看出开支起点能有多低。在 每 1,000,000 字符 $15.00 的费率下,按文中的示例算法,500 字符 × 30,000 次请求 每月约为 $0.225。这意味着你的主要工作与其说是压低单价,不如说是让各类用例的语音设置保持稳定。

我会把这份指南当作一份配置清单来读:估算成本、挑选说话人、设置基线控制、测试 413429 等错误码,然后上线。

Qwen-Audio-3.0-TTS:Flash 与 Plus 对比 – 定价、语音与用例一览
Qwen-Audio-3.0-TTS:Flash 与 Plus 对比 – 定价、语音与用例一览

Qwen-Audio-3.0-TTS 定价与计费

Qwen-Audio-3.0-TTS

Qwen-Audio-3.0-TTS 按输入文本字符计费[1]

计费单位如何计算

两个模型版本——FlashPlus——都按每 1,000,000 字符的输入文本计费。只有 input 字段内的文本才会被计费[1]。每次请求最多可包含 4,096 字符[1]

Flash 很适合低延迟、高并发的任务。Plus 则更适合旁白和品牌语音工作。

如何估算你的月度成本

算法相当简单:取每次请求的平均字符数,乘以你的月度请求量,除以 1,000,000,再乘以每百万字符的费率。

每 100 万字符 $15.00 的示例价格为例,情况大致如下:

用例平均字符/请求月度请求量预估月度成本
聊天助手50030,000~$0.225
客户支持1,20030,000~$0.54
视频旁白10,00030,000~$4.50

短回复通常花费极少。较长的旁白则会累加得更快。

APIMart 计费在多模型项目中如何运作

GccAi

如果你的工作流用到不止一个模型,就要用各自的计费单位来衡量每一个。

在混用音频、文本、图像或视频的 APIMart 项目中,要分别跟踪每个模型。对 TTS,跟踪字符数;对文本模型,跟踪 token;对图像模型,跟踪调用次数;对视频模型,跟踪秒数。

成本明确之后,下一步就是选择塑造输出的语音控制项。

Qwen-Audio-3.0-TTS 中的语音控制

既然定价已经清楚,下一步就是塑造语音。

Qwen-Audio-3.0-TTS 把语音控制分成两部分。结构化参数负责核心配置,而 instruct 负责风格。如果你想要可重复的输出,就依赖结构化字段。如果你想让语气或情绪发生变化,就使用 instruct

说话人、语言与输出格式

该 API 内置 9 个预定义说话人档案,每个都有自己的音色和语音风格[2]。对于英语应用,RyanAiden 是英语内容的最佳选择。如果你要面向多个市场,language 参数接受 EnglishChinese 等取值,或用 Auto 在 10 种支持的语言之间自动检测[2]

说话人语音描述母语
Ryan富有活力的男声,节奏感强英语
Aiden阳光的美式男声,中音清晰英语
Vivian明亮、略带棱角的年轻女声中文
Serena温暖、柔和的年轻女声中文
Uncle_Fu成熟男声,低沉圆润的音色中文
Dylan年轻男声,北京方言中文
Eric活泼男声,四川方言中文
Ono_Anna俏皮女声,轻盈灵动的音色日语
Sohee温暖女声,情感丰富韩语

这里有一条简单规则很有用:让说话人与目标语言相匹配。对于 en-US 内容,选 Ryan 或 Aiden 通常最合理[2]

在输出方面,你可以选择 mp3wavopuspcm。像 MP3WAV 这样的标准格式在现代浏览器和媒体工具中都表现良好[1][2]

语气、语速与情绪

speed 参数接受从 0.5 到 2.0 的数值范围,默认值为 1.0[2]。这一领域有文档记载的控制项是 speedinstruct,它们会影响情绪、音色、韵律和语气[2]

控制项请求字段期望取值/范围音频效果最适合的用例
说话人speakerVivian、Ryan、Aiden 等设定基础音色和母语口音品牌角色、本地化内容
语言languageEnglishChineseAuto决定发音和地区语言多语言应用
语速speed0.5–2.0(默认:1.0)改变说话速率教育内容、快速免责声明
情绪/语气instructVery happyAngryCalmIncredulous调整韵律和情感表达营销、游戏角色、支持
格式response_formatwavmp3pcmopus影响文件大小和兼容性浏览器播放和媒体工具

有一个细节值得留意:如果 instruct 要求兴奋的表达方式,即使 speed: 1.0 保持不变,语速也可能加快[2]。所以如果朗读听起来比预期更快,风格提示词可能就是原因。

结构化参数与提示词指令的对比

不妨把显式字段——speakerlanguagespeedresponse_format——看作你的生产基线。它们为每次请求设定核心的语音身份。而 instruct 则位于这个基础层之上,塑造语音的表现方式[2]

当你需要稳定的生产输出时,使用结构化参数。当你想要变化时,使用 instruct。在实践中,更具描述性的提示词往往比单词指令产生更细腻的结果[2]

这些默认设置会直接映射到下一节的请求体中。

如何通过 APIMart 发送 Qwen-Audio-3.0-TTS 请求

https://api.apimart.ai/v1/audio/speech 发送 POST 请求,并在 Authorization 头中传入你的 Bearer 令牌[1]

基本请求结构

主要字段有 modelinputvoicelanguageresponse_formatspeedinstruct[1][2]。另外,input 要保持在 4,096 字符以内。

这个请求把定价因素和语音设置放进了一个请求体:

{
  "model": "YOUR_QWEN_MODEL_ID",
  "input": "Welcome to our platform. We are excited to have you here.",
  "voice": "Aiden",
  "language": "English",
  "instruct": "Warm and welcoming tone",
  "response_format": "mp3",
  "speed": 1.0
}

简单来说,这些字段告诉 API 说什么怎么说以及返回哪种格式

若要做快速的 cURL 测试,使用:

curl --request POST \
  --url https://api.apimart.ai/v1/audio/speech \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "YOUR_QWEN_MODEL_ID",
    "input": "Your order has been confirmed and will ship shortly.",
    "voice": "Serena",
    "language": "English",
    "response_format": "opus"
  }' \
  --output confirmation.opus

这会把音频响应直接保存到 confirmation.opus[1]

常见场景的推荐设置

一旦你了解了请求的结构,选择设置就会容易得多。下表把常见用例映射到一个不错的起始预设。

场景建议版本voice语速Instruct 提示词成本敏感度
客户支持Flash (0.6B)Serena1.1Helpful
应用引导Plus (1.7B)Aiden1.0Warm and welcoming
教育旁白Plus (1.7B)Uncle_Fu0.9Authoritative and measured
广告创意Plus (1.7B)Vivian1.0Energetic and dynamic
产品视频配音Plus (1.7B)Ryan1.0Professional and clear

如果你需要多语言输出,把 language 设置为与你的文稿相匹配。该模型支持 10 种主要语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语[2]

速率限制、错误与生产检查

在进入生产之前,有意测试几个失败场景。这是那种能在日后省去大量麻烦的小步骤之一。

错误码含义建议操作
400参数无效检查 JSON 结构和可接受的取值
401API 密钥缺失或无效核实你的 Bearer 令牌
402账户余额不足为你的 APIMart 账户充值
413输入超过 4,096 字符把文本拆分成更小的片段
429超出速率限制用指数退避重试
500/502服务器或网关错误稍等片刻后重试

400 通常意味着请求体里有什么地方不对。413 则更直接:你的文本太长,所以要把它拆成更小的块。而如果你遇到 429,就退避后重试,而不是猛敲端点。

选择合适的配置与后续步骤

一个简单的决策框架

既然定价和语音控制都已确定,就用这最后一道过滤来把模型匹配到你要完成的工作。

依据预算语音控制用例来选择。

优先级最佳匹配建议版本
低延迟与高并发实时助手、IVR、实时翻译Flash
高并发的成本效率批量本地化、高并发客户支持Flash
富有表现力的品牌旁白品牌旁白、长篇音频、角色配音Plus

如果你在做长篇旁白,从头到尾坚持使用同一个说话人。把 instruct 写得紧凑、朴素、可重复。这通常能给你更稳定的输出和更少的意外。

对于更简单的配置,让它更加干净利落:挑一个说话人,只在需要时改动 instruct 字段。

带入实现环节的要点

一旦你选定了版本,就围绕你最常运行的场景来做配置。这能让你的上线计划立足于实际用量,而非边缘情况。

  • 在上线前设置用量告警。
  • 用各自的说话人、语速和 instruct 提示词验证每个场景。
  • 上线前用美国本地听众测试输出。
  • APIMart 让你可以切换版本而无需改动核心集成模式。

另外,在上线前测试你的系统如何处理 402429502

常见问题

我该如何拆分超过 4,096 字符的长文本?

把文本拆成 4,096 字符或更少的块,并把每个块单独发送给 API。

尽量在自然停顿点拆分,比如句子或段落的末尾。之后,把返回的音频文件合并成一条最终音轨。

为了输出一致,我应该锁定哪些语音设置?

对于稳定的长篇输出,使用 VoiceDesign 模型来设置一个清晰的人设和参考片段。然后用 create_voice_clone_prompt 创建一个可复用的提示词,并把该 voice_clone_prompt 传入 generate_voice_clone

锁定像 top_p 这样的生成设置也有帮助,可以防止语音随时间漂移。而且在上线之前,先做一次试运行以尽早发现问题。

我什么时候该选 Flash 而不是 Plus?

当速度和低延迟最为重要时,选择 Flash (0.6B)。它专为高并发用例而打造,比如实时虚拟助手、实时翻译和客户支持,这些场景对快速响应时间至关重要。

当质量和精度比速度更重要时,选择 Plus (1.7B)。它为有声书、专业配音和品牌媒体带来更好的韵律、更宽的情感范围和更高的准确度。

看完就试试

去模型市场挑选你想要的模型

在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。

聊天模型图像模型视频模型
进入模型市场