
Qwen-Audio-3.0-TTS API:定价与语音控制
Qwen-Audio-3.0-TTS 按每百万输入字符计费,单次请求上限 4,096 字符。对比 Flash 与 Plus 版本,设置语音、语言和语速,并测试错误码。
如果你打算使用 Qwen-Audio-3.0-TTS,有两个数字最先要关注:每 1,000,000 个输入字符的价格 和 每次请求 4,096 字符的上限。 我会据此做出配置选择,然后锁定 voice、language、speed、response_format 和 instruct 以获得稳定输出。
简短版本如下:
- 计费按字符计,且只有
input字段中的文本才计入。 - Flash 和 Plus 都按每 1,000,000 字符计费。
- 文中的示例费率使用 每 100 万字符 $15.00。
- 每次请求上限为 4,096 字符。
- 你可以通过以下方式控制输出:
- 用
voice选择说话人 - 用
language控制发音 - 用
speed,范围从 0.5 到 2.0 - 用
response_format,如mp3、wav、opus或pcm - 用
instruct控制语气、情绪和表达方式
- 用
- 该模型内置 9 个预设说话人并支持 10 种语言。
- Flash 适合低延迟、高并发的工作。
- Plus 适合旁白、品牌语音和较长篇幅的音频。
几个数字可以看出开支起点能有多低。在 每 1,000,000 字符 $15.00 的费率下,按文中的示例算法,500 字符 × 30,000 次请求 每月约为 $0.225。这意味着你的主要工作与其说是压低单价,不如说是让各类用例的语音设置保持稳定。
我会把这份指南当作一份配置清单来读:估算成本、挑选说话人、设置基线控制、测试 413 和 429 等错误码,然后上线。

Qwen-Audio-3.0-TTS 定价与计费

Qwen-Audio-3.0-TTS 按输入文本字符计费[1]。
计费单位如何计算
两个模型版本——Flash 和 Plus——都按每 1,000,000 字符的输入文本计费。只有 input 字段内的文本才会被计费[1]。每次请求最多可包含 4,096 字符[1]。
Flash 很适合低延迟、高并发的任务。Plus 则更适合旁白和品牌语音工作。
如何估算你的月度成本
算法相当简单:取每次请求的平均字符数,乘以你的月度请求量,除以 1,000,000,再乘以每百万字符的费率。
以 每 100 万字符 $15.00 的示例价格为例,情况大致如下:
| 用例 | 平均字符/请求 | 月度请求量 | 预估月度成本 |
|---|---|---|---|
| 聊天助手 | 500 | 30,000 | ~$0.225 |
| 客户支持 | 1,200 | 30,000 | ~$0.54 |
| 视频旁白 | 10,000 | 30,000 | ~$4.50 |
短回复通常花费极少。较长的旁白则会累加得更快。
APIMart 计费在多模型项目中如何运作

如果你的工作流用到不止一个模型,就要用各自的计费单位来衡量每一个。
在混用音频、文本、图像或视频的 APIMart 项目中,要分别跟踪每个模型。对 TTS,跟踪字符数;对文本模型,跟踪 token;对图像模型,跟踪调用次数;对视频模型,跟踪秒数。
成本明确之后,下一步就是选择塑造输出的语音控制项。
Qwen-Audio-3.0-TTS 中的语音控制
既然定价已经清楚,下一步就是塑造语音。
Qwen-Audio-3.0-TTS 把语音控制分成两部分。结构化参数负责核心配置,而 instruct 负责风格。如果你想要可重复的输出,就依赖结构化字段。如果你想让语气或情绪发生变化,就使用 instruct。
说话人、语言与输出格式
该 API 内置 9 个预定义说话人档案,每个都有自己的音色和语音风格[2]。对于英语应用,Ryan 和 Aiden 是英语内容的最佳选择。如果你要面向多个市场,language 参数接受 English、Chinese 等取值,或用 Auto 在 10 种支持的语言之间自动检测[2]。
| 说话人 | 语音描述 | 母语 |
|---|---|---|
| Ryan | 富有活力的男声,节奏感强 | 英语 |
| Aiden | 阳光的美式男声,中音清晰 | 英语 |
| Vivian | 明亮、略带棱角的年轻女声 | 中文 |
| Serena | 温暖、柔和的年轻女声 | 中文 |
| Uncle_Fu | 成熟男声,低沉圆润的音色 | 中文 |
| Dylan | 年轻男声,北京方言 | 中文 |
| Eric | 活泼男声,四川方言 | 中文 |
| Ono_Anna | 俏皮女声,轻盈灵动的音色 | 日语 |
| Sohee | 温暖女声,情感丰富 | 韩语 |
这里有一条简单规则很有用:让说话人与目标语言相匹配。对于 en-US 内容,选 Ryan 或 Aiden 通常最合理[2]。
在输出方面,你可以选择 mp3、wav、opus 或 pcm。像 MP3 和 WAV 这样的标准格式在现代浏览器和媒体工具中都表现良好[1][2]。
语气、语速与情绪
speed 参数接受从 0.5 到 2.0 的数值范围,默认值为 1.0[2]。这一领域有文档记载的控制项是 speed 和 instruct,它们会影响情绪、音色、韵律和语气[2]。
| 控制项 | 请求字段 | 期望取值/范围 | 音频效果 | 最适合的用例 |
|---|---|---|---|---|
| 说话人 | speaker | Vivian、Ryan、Aiden 等 | 设定基础音色和母语口音 | 品牌角色、本地化内容 |
| 语言 | language | English、Chinese、Auto 等 | 决定发音和地区语言 | 多语言应用 |
| 语速 | speed | 0.5–2.0(默认:1.0) | 改变说话速率 | 教育内容、快速免责声明 |
| 情绪/语气 | instruct | Very happy、Angry、Calm、Incredulous | 调整韵律和情感表达 | 营销、游戏角色、支持 |
| 格式 | response_format | wav、mp3、pcm、opus | 影响文件大小和兼容性 | 浏览器播放和媒体工具 |
有一个细节值得留意:如果 instruct 要求兴奋的表达方式,即使 speed: 1.0 保持不变,语速也可能加快[2]。所以如果朗读听起来比预期更快,风格提示词可能就是原因。
结构化参数与提示词指令的对比
不妨把显式字段——speaker、language、speed 和 response_format——看作你的生产基线。它们为每次请求设定核心的语音身份。而 instruct 则位于这个基础层之上,塑造语音的表现方式[2]。
当你需要稳定的生产输出时,使用结构化参数。当你想要变化时,使用 instruct。在实践中,更具描述性的提示词往往比单词指令产生更细腻的结果[2]。
这些默认设置会直接映射到下一节的请求体中。
如何通过 APIMart 发送 Qwen-Audio-3.0-TTS 请求
向 https://api.apimart.ai/v1/audio/speech 发送 POST 请求,并在 Authorization 头中传入你的 Bearer 令牌[1]。
基本请求结构
主要字段有 model、input、voice、language、response_format、speed 和 instruct[1][2]。另外,input 要保持在 4,096 字符以内。
这个请求把定价因素和语音设置放进了一个请求体:
{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Welcome to our platform. We are excited to have you here.",
"voice": "Aiden",
"language": "English",
"instruct": "Warm and welcoming tone",
"response_format": "mp3",
"speed": 1.0
}
简单来说,这些字段告诉 API 说什么、怎么说以及返回哪种格式。
若要做快速的 cURL 测试,使用:
curl --request POST \
--url https://api.apimart.ai/v1/audio/speech \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Your order has been confirmed and will ship shortly.",
"voice": "Serena",
"language": "English",
"response_format": "opus"
}' \
--output confirmation.opus
这会把音频响应直接保存到 confirmation.opus[1]。
常见场景的推荐设置
一旦你了解了请求的结构,选择设置就会容易得多。下表把常见用例映射到一个不错的起始预设。
| 场景 | 建议版本 | voice | 语速 | Instruct 提示词 | 成本敏感度 |
|---|---|---|---|---|---|
| 客户支持 | Flash (0.6B) | Serena | 1.1 | Helpful | 高 |
| 应用引导 | Plus (1.7B) | Aiden | 1.0 | Warm and welcoming | 中 |
| 教育旁白 | Plus (1.7B) | Uncle_Fu | 0.9 | Authoritative and measured | 中 |
| 广告创意 | Plus (1.7B) | Vivian | 1.0 | Energetic and dynamic | 低 |
| 产品视频配音 | Plus (1.7B) | Ryan | 1.0 | Professional and clear | 低 |
如果你需要多语言输出,把 language 设置为与你的文稿相匹配。该模型支持 10 种主要语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语[2]。
速率限制、错误与生产检查
在进入生产之前,有意测试几个失败场景。这是那种能在日后省去大量麻烦的小步骤之一。
| 错误码 | 含义 | 建议操作 |
|---|---|---|
| 400 | 参数无效 | 检查 JSON 结构和可接受的取值 |
| 401 | API 密钥缺失或无效 | 核实你的 Bearer 令牌 |
| 402 | 账户余额不足 | 为你的 APIMart 账户充值 |
| 413 | 输入超过 4,096 字符 | 把文本拆分成更小的片段 |
| 429 | 超出速率限制 | 用指数退避重试 |
| 500/502 | 服务器或网关错误 | 稍等片刻后重试 |
400 通常意味着请求体里有什么地方不对。413 则更直接:你的文本太长,所以要把它拆成更小的块。而如果你遇到 429,就退避后重试,而不是猛敲端点。
选择合适的配置与后续步骤
一个简单的决策框架
既然定价和语音控制都已确定,就用这最后一道过滤来把模型匹配到你要完成的工作。
依据预算、语音控制和用例来选择。
| 优先级 | 最佳匹配 | 建议版本 |
|---|---|---|
| 低延迟与高并发 | 实时助手、IVR、实时翻译 | Flash |
| 高并发的成本效率 | 批量本地化、高并发客户支持 | Flash |
| 富有表现力的品牌旁白 | 品牌旁白、长篇音频、角色配音 | Plus |
如果你在做长篇旁白,从头到尾坚持使用同一个说话人。把 instruct 写得紧凑、朴素、可重复。这通常能给你更稳定的输出和更少的意外。
对于更简单的配置,让它更加干净利落:挑一个说话人,只在需要时改动 instruct 字段。
带入实现环节的要点
一旦你选定了版本,就围绕你最常运行的场景来做配置。这能让你的上线计划立足于实际用量,而非边缘情况。
- 在上线前设置用量告警。
- 用各自的说话人、语速和
instruct提示词验证每个场景。 - 上线前用美国本地听众测试输出。
- APIMart 让你可以切换版本而无需改动核心集成模式。
另外,在上线前测试你的系统如何处理 402、429 和 502。
常见问题
我该如何拆分超过 4,096 字符的长文本?
把文本拆成 4,096 字符或更少的块,并把每个块单独发送给 API。
尽量在自然停顿点拆分,比如句子或段落的末尾。之后,把返回的音频文件合并成一条最终音轨。
为了输出一致,我应该锁定哪些语音设置?
对于稳定的长篇输出,使用 VoiceDesign 模型来设置一个清晰的人设和参考片段。然后用 create_voice_clone_prompt 创建一个可复用的提示词,并把该 voice_clone_prompt 传入 generate_voice_clone。
锁定像 top_p 这样的生成设置也有帮助,可以防止语音随时间漂移。而且在上线之前,先做一次试运行以尽早发现问题。
我什么时候该选 Flash 而不是 Plus?
当速度和低延迟最为重要时,选择 Flash (0.6B)。它专为高并发用例而打造,比如实时虚拟助手、实时翻译和客户支持,这些场景对快速响应时间至关重要。
当质量和精度比速度更重要时,选择 Plus (1.7B)。它为有声书、专业配音和品牌媒体带来更好的韵律、更宽的情感范围和更高的准确度。
去模型市场挑选你想要的模型
在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。