
Qwen-Audio-3.0-TTS API: 요금 및 음성 제어
Qwen-Audio-3.0-TTS는 입력 100만 자당 과금하며 요청당 4,096자 제한이 있습니다. Flash와 Plus 등급 비교, voice·언어·속도 설정, 오류 코드 테스트를 알아보세요.
Qwen-Audio-3.0-TTS를 사용할 계획이라면, 먼저 두 숫자가 중요합니다: _입력 1,000,000자당 가격_과 요청당 4,096자 제한. 저라면 이를 기준으로 설정을 정한 뒤, 안정적인 출력을 위해 voice, language, speed, response_format, instruct를 고정하겠습니다.
간단히 요약하면 다음과 같습니다:
- 과금은 문자 기반이며,
input필드의 텍스트만 계산됩니다. - Flash와 Plus 모두 1,000,000자 단위로 과금됩니다.
- 이 글의 예시 요율은 100만 자당 $15.00을 사용합니다.
- 각 요청은 4,096자로 제한됩니다.
- 다음으로 출력을 제어할 수 있습니다:
- 화자 선택을 위한
voice - 발음을 위한
language - 0.5에서 2.0 범위의
speed mp3,wav,opus,pcm같은response_format- 어조, 분위기, 전달 방식을 위한
instruct
- 화자 선택을 위한
- 이 모델은 9개의 사전 설정 화자를 포함하며 10개 언어를 지원합니다.
- Flash는 저지연 대량 작업에 적합합니다.
- Plus는 내레이션, 브랜드 음성, 장편 오디오에 적합합니다.
몇 가지 숫자가 지출이 얼마나 낮게 시작할 수 있는지 보여줍니다. 1,000,000자당 $15.00에서 500자 x 30,000회 요청은 이 글의 예시 계산상 약 월 $0.225로 나옵니다. 즉, 주된 과제는 원가 그 자체보다 사용 사례 전반에서 음성 설정을 안정적으로 유지하는 데 있습니다.
저라면 이 가이드를 설정 체크리스트로 읽겠습니다: 비용을 추정하고, 화자를 고르고, 기본 제어를 설정하고, 413과 429 같은 오류 코드를 테스트한 다음 출시.

Qwen-Audio-3.0-TTS 요금 및 과금

Qwen-Audio-3.0-TTS는 입력 텍스트 문자 수로 과금됩니다[1].
요금 단위의 작동 방식
두 모델 등급인 Flash와 Plus는 모두 입력 텍스트 1,000,000자 단위로 과금됩니다. input 필드 내부의 텍스트만 과금됩니다[1]. 각 요청에는 최대 4,096자까지 포함할 수 있습니다[1].
Flash는 저지연 대량 작업에 적합합니다. Plus는 내레이션과 브랜드 음성 작업에 더 잘 맞습니다.
월간 비용 추정 방법
계산은 꽤 간단합니다: 요청당 평균 문자 수를 구해 월간 요청량을 곱하고, 1,000,000으로 나눈 뒤, 100만 자당 요율을 곱하면 됩니다.
예시 가격 100만 자당 $15.00을 사용하면 다음과 같은 모습이 됩니다:
| 사용 사례 | 요청당 평균 문자 수 | 월간 요청 수 | 예상 월 비용 |
|---|---|---|---|
| 챗봇 어시스턴트 | 500 | 30,000 | ~$0.225 |
| 고객 지원 | 1,200 | 30,000 | ~$0.54 |
| 영상 내레이션 | 10,000 | 30,000 | ~$4.50 |
짧은 응답은 보통 비용이 매우 적게 듭니다. 긴 내레이션은 더 빠르게 쌓입니다.
멀티 모델 프로젝트 전반에서 APIMart 과금이 작동하는 방식

워크플로에서 둘 이상의 모델을 사용한다면, 각 모델을 고유한 과금 단위로 측정하세요.
오디오, 텍스트, 이미지, 영상을 혼합하는 APIMart 프로젝트에서는 각 모델을 개별적으로 추적하세요. TTS는 문자를, 텍스트 모델은 토큰을, 이미지 모델은 호출 수를, 영상 모델은 초 단위를 추적하세요.
비용이 정해지면, 다음 단계는 출력을 형성하는 음성 제어를 선택하는 것입니다.
Qwen-Audio-3.0-TTS의 음성 제어
요금이 명확해졌으니, 다음 단계는 음성을 형성하는 것입니다.
Qwen-Audio-3.0-TTS는 음성 제어를 두 부분으로 나눕니다. 구조화된 파라미터가 핵심 설정을 담당하고, instruct가 스타일을 담당합니다. 반복 가능한 출력을 원한다면 구조화된 필드에 기대세요. 어조나 감정을 바꾸고 싶다면 instruct를 사용하세요.
화자, 언어, 출력 형식
이 API는 각각 고유한 음색과 음성 스타일을 지닌 9개의 사전 정의된 화자 프로파일을 제공합니다[2]. 영어 앱에는 Ryan과 Aiden이 영어 콘텐츠에 가장 좋은 선택입니다. 둘 이상의 시장을 대상으로 구축한다면, language 파라미터는 English, Chinese 같은 값이나 10개 지원 언어 전반의 자동 감지를 위한 Auto 값을 받습니다[2].
| 화자 | 음성 설명 | 모국어 |
|---|---|---|
| Ryan | 역동적인 남성, 강한 리듬감 | English |
| Aiden | 밝은 미국식 남성, 선명한 중음역 | English |
| Vivian | 밝고 살짝 날이 선 젊은 여성 | Chinese |
| Serena | 따뜻하고 부드러운 젊은 여성 | Chinese |
| Uncle_Fu | 노련한 남성, 낮고 부드러운 음색 | Chinese |
| Dylan | 젊은 남성, 베이징 방언 | Chinese |
| Eric | 활기찬 남성, 쓰촨 방언 | Chinese |
| Ono_Anna | 장난기 있는 여성, 가볍고 민첩한 음색 | Japanese |
| Sohee | 따뜻한 여성, 풍부한 감정 | Korean |
여기서는 간단한 규칙이 잘 통합니다: 화자를 대상 언어에 맞추세요. en-US 콘텐츠에는 보통 Ryan이나 Aiden이 가장 합리적입니다[2].
출력의 경우 mp3, wav, opus, pcm 중에서 선택할 수 있습니다. MP3와 WAV 같은 표준 형식은 최신 브라우저와 미디어 도구 전반에서 잘 작동합니다[1][2].
어조, 속도, 감정
speed 파라미터는 0.5에서 2.0까지의 숫자 범위를 받으며 기본값은 1.0입니다[2]. 이 영역에서 문서화된 제어는 speed와 instruct이며, 감정, 음색, 운율, 어조에 영향을 줍니다[2].
| 제어 | 요청 필드 | 예상 값 / 범위 | 오디오 효과 | 가장 적합한 사용 사례 |
|---|---|---|---|---|
| 화자 | speaker | Vivian, Ryan, Aiden 등 | 기본 음색과 모국어 억양 설정 | 브랜드 캐릭터, 현지화 콘텐츠 |
| 언어 | language | English, Chinese, Auto 등 | 발음과 로케일 결정 | 다국어 앱 |
| 속도 | speed | 0.5–2.0 (기본값: 1.0) | 말하기 속도 변경 | 교육 콘텐츠, 빠른 고지사항 |
| 감정/어조 | instruct | Very happy, Angry, Calm, Incredulous | 운율과 감정 전달 변화 | 마케팅, 게임 캐릭터, 지원 |
| 형식 | response_format | wav, mp3, pcm, opus | 파일 크기와 호환성에 영향 | 브라우저 재생 및 미디어 도구 |
한 가지 주의할 점: instruct가 흥분된 전달을 요청하면, speed: 1.0이 그대로 유지되어도 말의 속도가 빨라질 수 있습니다[2]. 따라서 읽기가 예상보다 빠르게 느껴진다면 스타일 프롬프트가 원인일 수 있습니다.
구조화된 파라미터 대 프롬프트 지시
명시적 필드인 speaker, language, speed, response_format을 프로덕션 기준선으로 생각하면 도움이 됩니다. 이들은 각 요청의 핵심 음성 정체성을 설정합니다. 그런 다음 instruct가 그 기반 계층 위에 얹혀 음성이 어떻게 연기하는지를 형성합니다[2].
안정적인 프로덕션 출력이 필요할 때는 구조화된 파라미터를 사용하세요. 변화를 원할 때는 instruct를 사용하세요. 실제로는 한 단어 지시보다 더 서술적인 프롬프트가 더 섬세한 결과를 내는 경향이 있습니다[2].
이 기본값들은 다음 섹션의 요청 본문으로 그대로 이어집니다.
APIMart를 통해 Qwen-Audio-3.0-TTS 요청 보내는 방법
https://api.apimart.ai/v1/audio/speech로 POST 요청을 보내고 Authorization 헤더에 Bearer 토큰을 전달하세요[1].
기본 요청 구조
주요 필드는 model, input, voice, language, response_format, speed, instruct입니다[1][2]. 또한 input을 4,096자 미만으로 유지하세요.
이 요청은 요금 요소와 음성 설정을 하나의 본문에 담습니다:
{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Welcome to our platform. We are excited to have you here.",
"voice": "Aiden",
"language": "English",
"instruct": "Warm and welcoming tone",
"response_format": "mp3",
"speed": 1.0
}
간단히 말해, 이 필드들은 API에게 무엇을 말할지, 어떻게 말할지, 어떤 형식으로 반환할지를 알려줍니다.
빠른 cURL 테스트에는 다음을 사용하세요:
curl --request POST \
--url https://api.apimart.ai/v1/audio/speech \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Your order has been confirmed and will ship shortly.",
"voice": "Serena",
"language": "English",
"response_format": "opus"
}' \
--output confirmation.opus
이는 오디오 응답을 곧바로 confirmation.opus에 저장합니다[1].
일반적인 시나리오를 위한 권장 설정
요청 형태를 알고 나면 설정을 고르기가 훨씬 쉬워집니다. 아래 표는 일반적인 사용 사례를 좋은 시작 프리셋에 매핑합니다.
| 시나리오 | 권장 등급 | voice | 속도 | Instruct 프롬프트 | 비용 민감도 |
|---|---|---|---|---|---|
| 고객 지원 | Flash (0.6B) | Serena | 1.1 | Helpful | 높음 |
| 앱 온보딩 | Plus (1.7B) | Aiden | 1.0 | Warm and welcoming | 중간 |
| 교육 내레이션 | Plus (1.7B) | Uncle_Fu | 0.9 | Authoritative and measured | 중간 |
| 광고 크리에이티브 | Plus (1.7B) | Vivian | 1.0 | Energetic and dynamic | 낮음 |
| 제품 영상 보이스오버 | Plus (1.7B) | Ryan | 1.0 | Professional and clear | 낮음 |
다국어 출력이 필요하면 language를 스크립트에 맞게 설정하세요. 이 모델은 10개 주요 언어를 지원합니다: 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어[2].
요청 한도, 오류, 프로덕션 점검
프로덕션으로 넘어가기 전에 일부 실패 사례를 의도적으로 테스트하세요. 나중에 큰 고통을 덜어줄 수 있는 작은 단계 중 하나입니다.
| 오류 코드 | 의미 | 권장 조치 |
|---|---|---|
| 400 | 잘못된 파라미터 | JSON 구조와 허용 값 확인 |
| 401 | API 키 누락 또는 무효 | Bearer 토큰 확인 |
| 402 | 계정 잔액 부족 | APIMart 계정 충전 |
| 413 | 입력이 4,096자 초과 | 텍스트를 더 작은 조각으로 분할 |
| 429 | 요청 한도 초과 | 지수 백오프로 재시도 |
| 500/502 | 서버 또는 게이트웨이 오류 | 잠시 기다린 뒤 재시도 |
400은 대개 요청 본문에 무언가 잘못됐다는 뜻입니다. 413은 더 직관적입니다: 텍스트가 너무 길다는 것이니 더 작은 조각으로 나누세요. 그리고 429가 발생하면 엔드포인트를 두드려대는 대신 물러나서 재시도하세요.
올바른 설정 선택과 다음 단계
간단한 의사결정 프레임워크
요금과 음성 제어가 정해졌으니, 이 마지막 필터를 사용해 모델을 필요한 작업에 맞추세요.
예산, 음성 제어, 사용 사례를 기준으로 선택하세요.
| 우선순위 | 가장 적합 | 권장 등급 |
|---|---|---|
| 저지연 및 대량 | 실시간 어시스턴트, IVR, 실시간 번역 | Flash |
| 대량 비용 효율 | 대량 현지화, 대량 고객 지원 | Flash |
| 표현력 있는 브랜드 내레이션 | 브랜드 내레이션, 장편 오디오, 캐릭터 음성 | Plus |
장편 내레이션을 한다면 처음부터 끝까지 한 명의 화자를 유지하세요. instruct는 간결하고, 단순하며, 반복 가능하게 유지하세요. 그러면 보통 더 안정적인 출력과 더 적은 돌발 상황을 얻게 됩니다.
더 단순한 구성에서는 한층 깔끔하게 유지하세요: 한 명의 화자를 고르고 필요할 때만 instruct 필드만 바꾸세요.
구현으로 가져갈 핵심 사항
등급을 고르고 나면, 가장 자주 실행할 시나리오를 중심으로 설정을 구성하세요. 그러면 출시 계획이 엣지 케이스가 아니라 실제 사용에 기반하게 됩니다.
- 출시 전에 사용량 알림을 설정하세요.
- 각 시나리오를 고유한 화자, 속도,
instruct프롬프트로 검증하세요. - 출시 전에 미국 원어민 청취자로 출력을 테스트하세요.
- APIMart는 핵심 연동 패턴을 바꾸지 않고도 등급을 전환할 수 있게 해줍니다.
또한 출시 전에 시스템이 402, 429, 502를 어떻게 처리하는지 테스트하세요.
FAQ
4,096자를 초과하는 긴 텍스트는 어떻게 분할하나요?
텍스트를 4,096자 이하의 조각으로 나누고 각 조각을 API에 개별적으로 보내세요.
문장이나 문단의 끝처럼 자연스러운 멈춤 지점에서 나누도록 하세요. 그런 다음 반환된 오디오 파일들을 하나의 최종 트랙으로 결합하세요.
일관된 출력을 위해 어떤 음성 설정을 고정해야 하나요?
안정적인 장편 출력을 위해서는 VoiceDesign 모델을 사용해 명확한 페르소나와 참조 클립을 설정하세요. 그런 다음 create_voice_clone_prompt로 재사용 가능한 프롬프트를 만들고 그 voice_clone_prompt를 generate_voice_clone에 전달하세요.
시간이 지나도 음성이 흔들리지 않도록 top_p 같은 생성 설정을 고정하는 것도 도움이 됩니다. 그리고 출시 전에 리허설을 해서 문제를 일찍 잡아내세요.
언제 Plus 대신 Flash를 선택해야 하나요?
속도와 저지연이 가장 중요할 때 Flash(0.6B)를 선택하세요. 실시간 가상 어시스턴트, 실시간 번역, 고객 지원처럼 빠른 응답 시간이 중요한 고동시성 사용 사례를 위해 만들어졌습니다.
속도보다 품질과 정밀도가 더 중요할 때 Plus(1.7B)를 선택하세요. 오디오북, 전문 보이스오버, 브랜드 미디어를 위해 더 나은 운율, 더 넓은 감정 범위, 더 높은 정확도를 제공합니다.
모델 마켓에서 원하는 모델을 선택하세요
APIMart 모델 마켓에서 채팅, 이미지, 비디오 모델을 사용해 보고 하나의 통합 API로 모델 기능을 빠르게 경험하세요.