APIMart
Wan 2.5 Preview 시작하는 방법

Wan 2.5 Preview 시작하는 방법

개발자를 위한 Wan 2.5 Preview 빠른 가이드 — API 설정, 영화 같은 T2V·I2V 프롬프트 작성, 동기화 오디오 추가, 1080p 영상의 비용 관리까지 한눈에 정리했습니다.

튜토리얼

Wan 2.5 PreviewAlibaba가 만든 영상 생성 도구로, 텍스트 설명이나 이미지를 동기화된 오디오가 담긴 짧고 영화 같은 클립으로 바꿔 줍니다. 텍스트-투-비디오(T2V)와 이미지-투-비디오(I2V) 두 가지 모드를 지원합니다. Kling V3 같은 다른 고성능 모델도 비슷한 영화적 기능을 제공합니다. 주요 특징으로는 한 번의 패스로 이루어지는 오디오·비주얼 생성, 정밀한 립싱크, 그리고 5초 또는 10초 영상을 24fps에서 최대 1080p로 출력하는 기능이 있습니다. APIMart를 통해 통합 API로 매끄럽게 접근할 수 있어 연동이 쉽습니다. 가격은 480p 기준 초당 $0.0336부터 시작합니다. 시작하기 전에 알아 두어야 할 내용은 다음과 같습니다:

  • 모드: T2V는 텍스트 프롬프트로 영상을 만들고, I2V는 이미지에 움직임을 더합니다.
  • 품질: 48kHz 스테레오 오디오와 함께 480p, 720p, 1080p로 출력합니다.
  • 가격: 사용한 만큼 지불하며, 생성된 영상의 초 단위로 과금됩니다.
  • 설정: REST API를 사용해 Python 또는 Node.js에서 동작합니다. APIMart의 API 키가 필요합니다.
  • 워크플로: 요청을 제출하고, 태스크 ID를 받은 뒤 결과를 폴링합니다.

먼저 5초짜리 480p 클립으로 설정을 테스트해 보세요. 익숙해지면 최종 렌더링을 위해 1080p로 확장하면 됩니다. 더 나은 결과를 위해 상세한 프롬프트를 사용하고, 동기화된 사운드를 위해 오디오 지시를 함께 넣으세요.

이 가이드는 환경 설정부터 프롬프트 작성, 그리고 효과적인 비용 관리까지 모든 것을 다룹니다.

환경 설정하기

개발자 사전 준비 사항

코드를 작성하기 전에 몇 가지 기본기를 익혀 두는 것이 중요합니다. Wan 2.5와의 모든 상호작용은 이 표준에 의존하므로 REST APIJSON 형식을 잘 이해하고 있어야 합니다. Python 3.x를 선호하든 **Node.js(v14+)**를 선호하든, 이 설정에는 둘 다 사용할 수 있습니다.

이해해야 할 또 다른 핵심 개념은 비동기 워크플로입니다. Wan 2.5는 완성된 영상을 즉시 전달하지 않습니다. 대신 여러분이 모니터링해야 할 task_id를 제공합니다. 태스크 상태가 "completed"로 갱신될 때까지 확인하는 폴링 루프를 만들어야 합니다. 준비가 되면 APIMart로 가서 계정을 만들고 API 키를 받으세요.

APIMart 계정 및 API 키 만들기

GccAi

먼저 apimart.ai를 방문해 무료 계정을 만드세요. 로그인한 뒤 콘솔 대시보드의 API Key Management 섹션으로 이동해 API 키를 생성합니다. 키는 한 번만 표시되므로 바로 복사해 안전하게 보관하세요.

APIMart는 사용한 만큼 지불하는 모델을 사용하므로, 요청을 보내기 전에 계정에 잔액을 충전해야 합니다. 402 오류가 발생하면 계정 잔액이 너무 낮다는 뜻입니다. 반면 401 오류는 API 키에 문제가 있음을 나타냅니다. 자격 증명을 다시 확인하고 계정에 충분한 잔액이 있는지 살펴보세요.

개발 환경 구성하기

API 키가 준비되면 환경 설정은 간단합니다. APIMart는 OpenAI SDK와 호환됩니다. 시작하려면:

  • Python의 경우: pip install openai 실행
  • Node.js의 경우: npm install openai 실행

표준 OpenAI 설정과 유일하게 다른 점은 base URL입니다. 다음과 같이 설정하세요:

https://api.apimart.ai/v1

다음처럼 헤더에 API 키를 Bearer 토큰으로 포함해 요청을 인증하세요:

Authorization: Bearer YOUR_API_KEY

보안을 강화하려면 API 키를 스크립트에 직접 하드코딩하지 마세요. 대신 환경 변수에 저장하세요. 로컬 개발 중에는 .env 파일을 사용해 자격 증명을 안전하게 유지하고 버전 관리에서 제외하는 것이 좋은 습관입니다. 환경 구성이 끝나면 첫 API 요청을 보내는 단계로 넘어갈 수 있습니다.

첫 API 요청 보내기

텍스트-투-비디오 요청 예시

설정을 마쳤다면 이제 첫 API 요청을 해 볼 차례입니다! 앞서 언급했듯이 이 요청은 비동기이므로, 결과를 얻기 전에 태스크가 완료될 때까지 기다려야 합니다.

다음은 텍스트-투-비디오 출력을 생성하기 시작하는 간단한 Python 예시입니다:

import openai
import os

client = openai.OpenAI(
    api_key=os.environ["APIMART_API_KEY"],
    base_url="https://api.apimart.ai/v1"
)

response = client.post("/wan2.5-t2v-preview", json={
    "model": "wan2.5-t2v-preview",
    "input": {
        "prompt": "A golden retriever runs along a sunlit beach, waves crashing in slow motion",
        "negative_prompt": "low quality, blurry, distorted",
        "duration": 5,
        "size": "1280*720",
        "prompt_extend": True
    }
})

task_id = response.json()["task_id"]
print(f"Task started: {task_id}")

여기서 유일하게 필수인 필드는 prompt로, 만들고 싶은 장면을 설명합니다. negative_promptsize 같은 다른 매개변수는 출력을 다듬는 데 도움을 줍니다. 프롬프트가 짧다면 prompt_extendtrue로 설정해 모델이 더 상세하고 영화 같은 설명으로 확장하도록 할 수 있습니다. 종횡비 대신 1280*720처럼 정확한 크기를 사용해야 한다는 점을 기억하세요.

요청을 제출하면 task_id를 받게 됩니다. 이 ID로 태스크가 SUCCEEDED로 표시될 때까지 상태 엔드포인트를 폴링하세요:

import time

while True:
    result = client.get(f"/tasks/{task_id}")
    status = result.json()["task_status"]
    if status == "SUCCEEDED":
        video_url = result.json()["video_url"]
        print(f"Video ready: {video_url}")
        break
    elif status == "FAILED":
        print("Generation failed.")
        break
    time.sleep(15)

영상 생성은 보통 1~5분 정도 걸립니다. 영상이 준비되면 URL이 24시간 후 만료되므로 그 안에 다운로드하세요.

다음으로 비슷한 방식으로 이미지에서 영상을 생성하는 방법을 살펴보겠습니다. 다양한 영화적 스타일을 원한다면 Grok Imagine Video 같은 다른 모델도 살펴볼 수 있습니다.

이미지-투-비디오 요청 예시

이미지-투-비디오(I2V) 과정은 동일한 비동기 워크플로를 따르지만 두 가지 중요한 차이가 있습니다. wan2.5-i2v-preview 모델을 지정하고, 원본 이미지를 가리키는 image_url을 제공해야 합니다.

다음은 예시입니다:

response = client.post("/wan2.5-i2v-preview", json={
    "model": "wan2.5-i2v-preview",
    "input": {
        "image_url": "https://your-storage.com/character-portrait.jpg",
        "prompt": "The character slowly turns their head and smiles at the camera",
        "duration": 5,
        "resolution": "720p",
        "negative_prompt": "blurry, artifacts"
    }
})

I2V의 경우 prompt는 캐릭터의 움직임이나 카메라 동작처럼 시작 이미지를 기준으로 한 움직임이나 변화를 설명해야 합니다. 종횡비는 원본 이미지에 맞춰지므로, 제출 전에 원하는 비율(예: 16:9, 9:16, 1:1)로 잘라 두세요. 원본 이미지는 어느 한 변이 360~2,000픽셀 사이여야 하고 10MB를 넘지 않아야 합니다.

텍스트-투-비디오와 마찬가지로 응답에서 task_id를 확보하고, 동일한 폴링 로직으로 태스크가 완료될 때까지 상태를 추적하세요.

이제 각 필드가 무엇을 의미하는지 이해하기 위해 API 응답 구조를 분석해 보겠습니다.

API 응답 이해하기

POST 요청이 성공하면 API는 태스크 진행 상황을 확인하는 데 사용할 수 있는 task_id가 담긴 JSON 객체를 반환합니다. 태스크가 끝나면 다음 필드를 받게 됩니다:

필드유형설명
task_id / idString태스크의 고유 식별자입니다.
task_statusEnum태스크의 현재 상태: PENDING, RUNNING, SUCCEEDED, FAILED.
video_urlString생성된 MP4 영상으로의 직접 링크입니다.
meta.usageObjectcredits_used 같은 리소스 사용에 대한 세부 정보입니다.
errorObject태스크가 실패하면 오류 세부 정보가 담긴 namemessage가 들어 있습니다.

200 HTTP 상태 코드와 유효한 task_id는 요청이 수락되었음을 의미합니다. 태스크가 결국 실패하면 지원되지 않는 해상도 형식이나 지나치게 긴 프롬프트 같은 세부 사항은 error.message 필드를 확인하세요.

Wan 2.5 (the Veo 3 Killer) is NOW in n8n (full tutorial & template)

프롬프트 및 설정 최적화하기

환경을 설정하고 첫 API 요청을 마쳤다면(또는 더 새로운 WAN 2.6 API를 살펴봤다면), 프롬프트를 세밀하게 다듬어 영상 출력 품질을 크게 높일 수 있습니다.

좋은 텍스트 및 이미지 프롬프트 작성하기

여러분이 얻는 결과는 프롬프트를 얼마나 잘 짜느냐에 크게 좌우됩니다. Wan 2.5의 경우 80~120단어 사이의 프롬프트가 가장 효과적입니다. 명확한 지침을 줄 만큼 길면서도, 모델을 혼란스럽게 할 만큼 길지는 않기 때문입니다.

다음은 따라 하기 좋은 구조입니다: 피사체나 장면으로 시작해 카메라 움직임, 동작 세부 사항, 시각적 스타일을 더하세요. 예를 들어 "a woman walking in a city" 라고 하는 대신 다음처럼 쓸 수 있습니다: "A woman in a red coat walks briskly through a rain-soaked Manhattan street at dusk. Dolly in slowly. Puddles reflect neon signs. Teal-and-orange color grade, anamorphic bokeh, volumetric dusk lighting." 이 정도의 디테일은 분위기, 구도, 움직임에 대해 모델에 명확한 지시를 줍니다.

카메라를 제어하려면 Pan left/right, Tilt up/down, Dolly in/out, Orbital arc, Crane up/down 같은 표준 촬영 용어를 사용하세요. 시차(패럴랙스) 효과를 묘사해 깊이를 더하세요 — "foreground grass sways while mountains remain still in the background." 또한 "slow-motion" 이나 "whip-pan(빠른 카메라 팬)" 같은 용어로 속도감을 조절할 수 있습니다.

이미지-투-비디오 작업에서는 모델이 제공된 이미지를 기준으로 삼으므로, 움직임이나 표정 변화를 묘사하는 데 집중하세요.

시각적 프롬프트가 확정되면, 동기화된 오디오와 대사를 넣어 한 단계 더 나아갈 수 있습니다.

오디오 및 대사 추가하기

Wan 2.5의 두드러진 기능 중 하나는 영상과 오디오를 동시에 생성해 음성, 주변음, 효과음이 완전히 동기화된 경험을 만드는 능력입니다.

"Wan 2.5를 진정으로 특별하게 만드는 것은 무음 영상만이 아니라 완전한 오디오·비주얼 경험을 단 한 번의 패스로 생성하는 능력이다." - Scenario Knowledge Base [9]

립싱크 대사를 원한다면 캐릭터의 대사를 따옴표 안에 넣으세요. 예: "A scientist looks into the camera and says, 'The results are extraordinary.'" 환경음은 구체적으로 지정하세요: "rain taps against a window, distant traffic hums." 모델은 이런 세부 사항을 최종 출력에 자동으로 통합합니다.

직접 만든 오디오를 사용하고 싶다면 .wav 또는 .mp3 형식(최대 크기: 15MB)의 커스텀 audio_url을 제공할 수 있습니다. 다만 오디오 파일은 영상 길이와 일치해야 하며, 더 짧으면 남은 프레임은 무음이 됩니다. 하나의 요청에서 audio_url을 여러 이미지 또는 영상 URL과 함께 사용할 때는 충돌이 생길 수 있으니 주의하세요 [4].

모델은 오디오 언어를 프롬프트에 자동으로 맞추므로, 프롬프트가 영어라면 오디오도 영어가 됩니다 — 별도의 단계가 필요 없습니다 [10].

이 정도의 동기화는 오디오와 영상이 매끄럽게 어우러져 세련된 최종 결과물을 만들도록 보장합니다.

해상도 및 길이 선택하기

API 요청을 다룰 때, 품질과 비용의 균형을 맞추려면 올바른 해상도와 길이를 고르는 것이 핵심입니다.

Wan 2.5 Preview는 고정된 두 가지 길이 — 5초 또는 10초 — 와 24fps에서 480p, 720p, 1080p 해상도를 제공합니다. 480p 5초 초안으로 콘셉트를 테스트한 뒤 최종 렌더링에서 1080p로 확장하세요.

다음은 자주 쓰는 사용 사례에 대한 간단한 참고표입니다:

사용 사례종횡비권장 해상도길이
YouTube / 프레젠테이션16:9 (1920×1080)1080p10s
TikTok / Reels / Shorts9:16 (1080×1920)1080p5–10s
Instagram 피드 / 정사각 광고1:1 (1440×1440)1080p5s
프로토타이핑 / 테스트Any480p5s
태블릿 / 클래식 디스플레이4:3 (1632×1248)720p5–10s

모든 해상도에는 48kHz 스테레오 오디오가 포함되므로, 저해상도 초안에서도 더 높은 품질의 렌더링에 들어가기 전에 오디오가 어떻게 들릴지 잘 가늠할 수 있습니다.

Wan 2.5를 멀티모달 워크플로에 통합하기

Wan 2.5 Preview: Pricing, Resolution & Use Case Comparison
Wan 2.5 Preview: 가격, 해상도 및 사용 사례 비교

API 실험을 어느 정도 해 봤다면, 이제 Wan 2.5를 프로덕션 파이프라인에 통합할 때입니다. APIMart를 사용하면 단일 API로 500개가 넘는 AI 모델에 접근할 수 있습니다. 이 구성 덕분에 추가 설정 없이 언어, 이미지, 영상 모델을 매끄럽게 결합할 수 있습니다.

스크립트-투-비디오 파이프라인 구축하기

다음은 흔히 쓰는 워크플로입니다: 언어 모델로 스크립트 초안을 작성하고 장면 단위로 나누는 것에서 시작합니다. 다음으로 이미지 생성 모델을 사용해 각 장면의 스토리보드를 만듭니다. 그 다음 Wan 2.5가 등장해 스토리보드와 장면 설명을 받아 영상 클립을 만들어 냅니다. 심지어 오디오까지 한 번에 동기화해 과정을 단순화합니다 [2][5].

모든 것을 APIMart 안에서 유지하면 워크플로가 간소해집니다. 하나의 API 구조, 하나의 인증 키, 그리고 하나의 청구 대시보드만 관리하면 됩니다. 이런 구성 덕분에 성능과 비용 사이의 균형을 세밀하게 조정하는 데 집중할 수 있습니다.

비용 및 성능 관리하기

지출을 효과적으로 관리하려면 프로젝트의 현재 단계에 맞춰 모델과 해상도를 조정하세요. 초기 초안에는 5초 클립에 480p 해상도를 사용하며, 클립당 43크레딧이 듭니다. 초안이 승인되면 5초 기준 85크레딧 또는 10초 기준 170크레딧의 720p로 업그레이드하세요. 최종 렌더링에서는 5초 기준 128크레딧 또는 10초 기준 255크레딧의 1080p로 올리면 됩니다 [1].

더 빠른 반복이 필요한가요? wan-2.5-fast 변형은 1080p에서 더 비용 효율적인 선택지를 제공하며, 10초 클립 비용을 255크레딧 대신 174크레딧으로 줄여 줍니다 [11]. 대규모로 이미지-투-비디오 작업을 진행한다면 wan2.6-i2v-flash 모델이 예산 친화적인 선택으로, 표준 Wan 2.6의 초당 $0.05와 비교해 720p에서 초당 $0.0168을 청구합니다 [7].

워크플로 예시: 콘셉트에서 최종 영상까지

비용과 성능을 최적화했다면 다음 단계별 과정을 따라 콘셉트를 실현하세요:

  • 스크립트 작성하기: APIMart를 통해 이용할 수 있는 GPT-5 같은 언어 모델로 상세한 장면 설명을 작성하세요. "soft piano music fades in"이나 "distant city traffic hums" 같은 구체적인 오디오 큐를 포함하세요.
  • 스토리보드 생성 및 480p 초안 장면 만들기: 장면 설명을 이미지 모델에 넣어 시각 가이드를 만드세요. 그런 다음 각 장면을 480p 5초로 Wan 2.5에서 테스트해 움직임, 속도감, 오디오 동기화를 평가하세요.
  • 1080p로 최종 렌더링하기: 초안이 만족스러우면 장면을 1080p로 다시 렌더링해 네이티브 48kHz 스테레오 오디오가 담긴 세련된 10초 MP4 출력을 얻으세요 [8].

"WAN 2.6의 일관성은 놀랍다! 캐릭터 이미지가 여러 클립에 걸쳐 안정적으로 유지되는데, 이는 전에는 이루기 어려웠던 일이다." - Wei Zhang, Independent Animator [7]

최종 렌더링에서 추가적인 향상을 원한다면 enable_prompt_expansion 매개변수를 사용하세요. 이 기능은 프롬프트를 영화적 디테일로 자동 보강해, 추가적인 수동 조정 없이도 출력 품질을 끌어올립니다 [12][3].

결론 및 다음 단계

이제 여러분은 첫 Wan 2.5 영상을 만드는 데 뛰어들 도구를 갖췄습니다. 내장된 원패스 오디오·비디오 동기화, 최대 1080p 해상도 지원, 텍스트-투-비디오와 이미지-투-비디오 같은 다재다능한 입력 모드를 갖춘 이 모델은 가벼운 시도가 아니라 진지한 프로덕션 작업에도 준비되어 있습니다.

시작하기 전에 설정이 완전히 준비되었는지 확인하세요. 먼저 480p 클립을 테스트하며 프롬프트를 세밀하게 다듬는 것으로 작게 시작하세요. 과정을 익혔다면 최종 렌더링을 위해 1080p로 확장하세요. 이 방식은 처음부터 너무 많은 리소스를 쏟지 않고도 실험하고 다듬을 수 있게 해 줍니다.

첫 프로젝트에서는 단일 장면에 집중해 보세요. 명확한 오디오 지시가 담긴 상세한 프롬프트를 작성하고, 짧은 5초 클립을 생성하세요. 처리 시간은 보통 1~5분으로 빠르고, 비용도 관리 가능한 수준이라 480p 클립 기준 초당 단 $0.0336부터 시작합니다 [6]. 도구를 탐색하고 익숙해지기에 저렴한 방법입니다.

확장할 준비가 되면 500개가 넘는 APIMart의 AI 모델 라이브러리를 활용하세요. 하나의 API 키와 청구 대시보드로 워크플로를 간소화하고 완전한 스크립트-투-비디오 파이프라인을 손쉽게 만들 수 있으며, 고품질 일관성을 위한 MiniMax-Hailuo 2.3 같은 대안도 살펴볼 수 있습니다.

FAQ

오래 실행되는 영상 태스크의 폴링과 타임아웃은 어떻게 처리하나요?

프로덕션 워크플로에서는 태스크를 생성할 때 callbackUrl 매개변수를 사용하는 것이 효율적입니다. 이렇게 하면 태스크가 완료되는 즉시 POST 요청을 자동으로 받게 됩니다.

폴링을 선호한다면 방식은 이렇습니다: 태스크를 제출해 taskId를 받고, 상태 엔드포인트를 조회하기 전에 50초를 기다리세요. 그 이후에는 5초마다 상태를 확인하세요. 시스템에 과부하가 걸리지 않도록 429 오류가 발생하면 잠시 멈췄다가 지연 후 재시도하도록 처리하세요.

5초 또는 10초 클립을 생성하기 전에 비용을 추정하는 가장 좋은 방법은 무엇인가요?

5초 또는 10초 영상 클립의 비용을 계산하려면 클립 길이(초)에 제공업체의 초당 요금을 곱하기만 하면 됩니다. 원하는 해상도 — 480p, 720p, 1080p 중 — 의 요금을 꼭 확인하세요. 더 높은 품질은 보통 더 높은 가격이 따릅니다. 예를 들어 5초 클립을 계산한다면 초당 요금에 5를 곱하고, 10초 클립이라면 10을 곱하세요.

프롬프트로 립싱크와 대사 품질을 어떻게 높일 수 있나요?

Wan 2.5 Preview에서 최상의 립싱크와 대사 품질을 얻으려면 구조화된 프롬프트를 사용하세요. 여기에는 캐릭터의 대사와 함께 감정, , 속도, 음색 같은 세부 사항을 명확히 지정해야 합니다. 이 정도의 디테일은 모델이 더 정확하고 자연스러운 결과를 내도록 돕습니다.

더 높은 정밀도를 원한다면 WAV 또는 MP3 형식의 커스텀 오디오 파일을 업로드할 수 있습니다. 이 파일은 모델이 표정과 입 움직임을 오디오에 완벽하게 맞추는 가이드 역할을 합니다.

입력 이미지가 선명하고 조명이 잘 든 상태인지 확인하세요. 고품질 이미지는 모델이 표정을 효과적으로 해석하고 재현하도록 보장합니다. 또한 프롬프트 확장 기능을 활용하면 모델이 더 잘 해석하도록 상세한 설명을 포함할 수 있습니다.

이제 직접 테스트해 보세요

모델 마켓에서 원하는 모델을 선택하세요

APIMart 모델 마켓에서 채팅, 이미지, 비디오 모델을 사용해 보고 하나의 통합 API로 모델 기능을 빠르게 경험하세요.

채팅 모델이미지 모델비디오 모델
모델 마켓 보기