
Wan 2.5 Preview 快速上手指南
面向开发者的 Wan 2.5 Preview 快速指南:接入 API、编写电影级 T2V 与 I2V 提示词、加入同步音频,并管理 1080p 视频的成本。
Wan 2.5 Preview 是 阿里巴巴 推出的视频生成工具,能把文字描述或图像转化为带同步音频的短片电影级片段。它支持两种模式:文本生成视频(T2V)和图像生成视频(I2V)。其他高性能模型,如 Kling V3,也提供类似的电影级能力。核心特性包括一次生成音画、精准对口型,以及最高 1080p、24fps、时长 5 秒或 10 秒的输出。通过 APIMart 平台可轻松集成,它提供统一 API 实现无缝接入。价格从 480p 每秒 $0.0336 起。以下是入门前你需要了解的内容:
- 模式:T2V 用于根据文字提示生成视频,I2V 用于为图像添加动态效果。
- 画质:输出 480p、720p 或 1080p,配 48kHz 立体声音频。
- 价格:按量付费,按生成视频的秒数计费。
- 接入:使用 REST API,支持 Python 或 Node.js。需要 APIMart 的 API key。
- 工作流:提交请求,获取 task ID,然后轮询结果。
先用一段 5 秒的 480p 片段来测试你的配置。熟悉后,再升级到 1080p 做最终渲染。使用详细的提示词能获得更好的效果,并加入音频指令实现声音同步。
本指南涵盖从搭建环境到编写提示词,再到有效管理成本的方方面面。
搭建你的环境
开发者前置条件
在开始写代码之前,先熟悉一些基础知识至关重要。你应当对 REST API 和 JSON 格式 有较好的掌握,因为与 Wan 2.5 的所有交互都依赖这些标准。无论你偏好 Python 3.x 还是 Node.js(v14+),都适用于本次配置。
另一个需要理解的关键概念是异步工作流。Wan 2.5 不会立即返回成品视频,而是提供一个 task_id 供你监控。你需要创建一个轮询循环,反复查询任务状态,直到它更新为 "completed"。准备就绪后,前往 APIMart 创建账户并获取你的 API key。
创建 APIMart 账户与 API Key

首先访问 apimart.ai 注册一个免费账户。登录后,进入控制台面板(Console Dashboard)的 API Key Management 部分生成你的 API key。请务必立即复制并妥善保存密钥——它只会显示一次。
APIMart 采用按量付费模式,因此你需要先为账户充值再发起请求。如果遇到 402 错误,说明你的账户余额过低。而 401 错误 则表示你的 API key 有问题。请仔细核对凭据,并确保账户余额充足。
配置你的开发环境
准备好 API key 后,搭建环境就很简单了。APIMart 兼容 OpenAI SDK。上手步骤:
- Python:运行
pip install openai - Node.js:运行
npm install openai
与标准 OpenAI 配置唯一的区别是 base URL。将它设置为:
https://api.apimart.ai/v1
在请求头中以 Bearer token 形式携带你的 API key 进行认证,如下所示:
Authorization: Bearer YOUR_API_KEY
为提升安全性,请避免将 API key 直接硬编码到脚本中。应把它存储在环境变量里。本地开发时使用 .env 文件是一种良好实践,可以让凭据安全且不进入版本控制。环境配置好后,你就可以开始发起第一批 API 请求了。
发起你的第一批 API 请求
文本生成视频请求示例
配置完成后,就可以着手第一次 API 请求了!如前所述,这些请求是异步的,也就是说你需要等待任务完成后才能拿到结果。
下面是一个简单的 Python 示例,用于开始生成文本生成视频的输出:
import openai
import os
client = openai.OpenAI(
api_key=os.environ["APIMART_API_KEY"],
base_url="https://api.apimart.ai/v1"
)
response = client.post("/wan2.5-t2v-preview", json={
"model": "wan2.5-t2v-preview",
"input": {
"prompt": "A golden retriever runs along a sunlit beach, waves crashing in slow motion",
"negative_prompt": "low quality, blurry, distorted",
"duration": 5,
"size": "1280*720",
"prompt_extend": True
}
})
task_id = response.json()["task_id"]
print(f"Task started: {task_id}")
这里唯一必填的字段是 prompt,用于描述你想创建的画面。其他参数,如 negative_prompt 和 size,有助于优化输出。如果提示词较短,将 prompt_extend 设为 true 可以让模型把它扩展成更详细、更具电影感的描述。请记得使用精确的尺寸,如 1280*720,而不是宽高比。
提交请求后,你会收到一个 task_id。用这个 ID 轮询状态端点,直到任务被标记为 SUCCEEDED:
import time
while True:
result = client.get(f"/tasks/{task_id}")
status = result.json()["task_status"]
if status == "SUCCEEDED":
video_url = result.json()["video_url"]
print(f"Video ready: {video_url}")
break
elif status == "FAILED":
print("Generation failed.")
break
time.sleep(15)
视频生成通常需要 1–5 分钟。视频就绪后,请在 24 小时内下载,因为链接会在此之后过期。
接下来,我们看看如何用类似的方式从图像生成视频。你也可以探索其他模型,如 Grok Imagine Video,尝试不同的电影风格。
图像生成视频请求示例
图像生成视频(I2V)流程遵循相同的异步工作流,但有两个关键区别:你需要指定 wan2.5-i2v-preview 模型,并提供一个指向源图像的 image_url。
示例如下:
response = client.post("/wan2.5-i2v-preview", json={
"model": "wan2.5-i2v-preview",
"input": {
"image_url": "https://your-storage.com/character-portrait.jpg",
"prompt": "The character slowly turns their head and smiles at the camera",
"duration": 5,
"resolution": "720p",
"negative_prompt": "blurry, artifacts"
}
})
对于 I2V,prompt 应描述相对于起始图像的运动或变化——例如角色动作或镜头运动。宽高比会与你的源图像一致,因此在提交前请确保它已裁剪为所需比例(如 16:9、9:16、1:1)。源图像任一边应在 360 到 2,000 像素之间,且不超过 10 MB。
与文本生成视频一样,从响应中获取 task_id,并使用相同的轮询逻辑跟踪任务状态,直到完成。
现在,我们来拆解一下 API 响应的结构,理解每个字段的含义。
理解 API 响应
当你成功发起 POST 请求时,API 会返回一个包含 task_id 的 JSON 对象,可用来查询任务进度。任务完成后,你会收到以下字段:
| 字段 | 类型 | 说明 |
|---|---|---|
task_id / id | String | 任务的唯一标识符。 |
task_status | Enum | 任务当前状态:PENDING、RUNNING、SUCCEEDED 或 FAILED。 |
video_url | String | 指向生成的 MP4 视频的直链。 |
meta.usage | Object | 资源用量详情,如 credits_used。 |
error | Object | 若任务失败,此字段包含 name 和 message,提供错误详情。 |
200 HTTP 状态码加上有效的 task_id 表示你的请求已被接受。如果任务最终失败,请查看 error.message 字段了解详情,例如不受支持的分辨率格式或提示词过长。
Wan 2.5 (the Veo 3 Killer) is NOW in n8n (full tutorial & template)
优化提示词与配置
在环境搭建好并完成初步 API 请求(或体验过较新的 WAN 2.6 API)后,微调你的提示词能大幅提升视频输出的质量。
编写优质的文本与图像提示词
你得到的效果在很大程度上取决于提示词的编写水平。对于 Wan 2.5,80 到 120 个词 之间的提示词效果最佳——既足够长以提供清晰的引导,又不至于长到让模型困惑。
这里有一个有用的结构可供参考:先写主体或场景,再加入镜头运动、动作细节和视觉风格。例如,与其说 "a woman walking in a city",你可以写:"A woman in a red coat walks briskly through a rain-soaked Manhattan street at dusk. Dolly in slowly. Puddles reflect neon signs. Teal-and-orange color grade, anamorphic bokeh, volumetric dusk lighting." 这种细节程度为模型提供了关于氛围、构图和动作的清晰指令。
要控制镜头,使用标准的摄影术语,如 Pan left/right、Tilt up/down、Dolly in/out、Orbital arc 或 Crane up/down。通过描述视差效果增加纵深感——"foreground grass sways while mountains remain still in the background." 你还可以用 "slow-motion" 或 "whip-pan(快速横摇镜头)" 之类的术语来调节节奏。
对于图像生成视频任务,请聚焦于描述动作或表情变化,因为模型会以提供的图像作为基础参考。
视觉提示词确定后,你可以更进一步,加入同步音频与对白。
加入音频与对白
Wan 2.5 的一大亮点是能够同时生成视频与音频,通过人声、环境声和音效创造出完全同步的体验。
"What truly sets Wan 2.5 apart is its ability to generate not just silent videos, but complete audio-visual experiences in a single pass." - Scenario Knowledge Base [9]
要实现对口型的对白,请把角色台词放在引号中,如:"A scientist looks into the camera and says, 'The results are extraordinary.'" 对于环境声,要具体:"rain taps against a window, distant traffic hums." 模型会自动将这些细节融入最终输出。
如果你想使用自己的音频,可以提供一个 .wav 或 .mp3 格式的自定义 audio_url(最大 15 MB)。不过音频文件的时长应与视频时长匹配;若较短,剩余的帧将没有声音。在单次请求中把 audio_url 与多个图像或视频 URL 组合使用时要小心,因为这可能导致冲突 [4]。
模型会自动将音频语言与你的提示词匹配,因此如果提示词是英文,音频也会是英文——无需额外操作 [10]。
这种同步程度确保了音频与画面无缝协作,呈现出精致的最终成品。
选择分辨率与时长
在处理 API 请求时,选择合适的分辨率和时长是平衡质量与成本的关键。
Wan 2.5 Preview 提供两种固定时长——5 秒或 10 秒——以及 24fps 下的 480p、720p 和 1080p 分辨率。先用 480p 的 5 秒草稿来测试你的构想,再升级到 1080p 做最终渲染。
以下是常见使用场景的快速参考:
| 使用场景 | 宽高比 | 推荐分辨率 | 时长 |
|---|---|---|---|
| YouTube / 演示 | 16:9 (1920×1080) | 1080p | 10s |
| TikTok / Reels / Shorts | 9:16 (1080×1920) | 1080p | 5–10s |
| Instagram 信息流 / 方形广告 | 1:1 (1440×1440) | 1080p | 5s |
| 原型 / 测试 | 任意 | 480p | 5s |
| 平板 / 经典显示 | 4:3 (1632×1248) | 720p | 5–10s |
所有分辨率都包含 48kHz 立体声音频,因此即便是低分辨率草稿,也能让你在投入更高质量渲染之前,对音频效果有个不错的预判。
将 Wan 2.5 集成到多模态工作流

当你尝试过一些 API 实验后,就该把 Wan 2.5 集成到你的生产管线中了。借助 APIMart,你可以通过单一 API 访问 500 多个 AI 模型。这种设置让你无需额外配置,就能无缝组合语言、图像和视频模型。
构建脚本到视频的管线
这是一个常见的工作流:先用一个语言模型起草脚本并将其分割成场景。接着,使用一个 图像生成模型 为每个场景创建分镜。然后,Wan 2.5 登场,接收分镜和场景描述来生成视频片段。它甚至能一次性同步音频,简化了整个流程 [2][5]。
把一切都放在 APIMart 内,能让你的工作流更加顺畅。你只需管理一套 API 结构、一个认证密钥和单一的计费面板。有了这样的配置,你就能专注于在性能与成本之间精细权衡。
管理成本与性能
要有效控制开支,应根据项目当前阶段来调整模型和分辨率。对于早期草稿,使用 480p 分辨率生成 5 秒片段,每段花费 43 credits。草稿获批后,升级到 720p,5 秒 85 credits 或 10 秒 170 credits。做最终渲染时,提升到 1080p,5 秒 128 credits 或 10 秒 255 credits [1]。
需要更快的迭代?wan-2.5-fast 变体为 1080p 提供了更具性价比的选择,将 10 秒片段的成本从 255 credits 降到 174 credits [11]。如果你要大规模处理图像生成视频任务,wan2.6-i2v-flash 模型是一个经济实惠的选择,在 720p 下每秒收费 $0.0168,而标准 Wan 2.6 为每秒 $0.05 [7]。
工作流示例:从构想到成片
在优化好成本与性能后,按照以下分步流程把你的构想变为现实:
- 编写脚本:使用像 GPT-5 这样的语言模型(可通过 APIMart 使用)来撰写详细的场景描述。加入具体的音频提示,如 "soft piano music fades in" 或 "distant city traffic hums"。
- 生成分镜并在 480p 下起草场景:把场景描述输入图像模型以创建视觉指引。然后用 Wan 2.5 在 480p 下测试每个场景 5 秒,评估动作、节奏和音频同步。
- 在 1080p 下做最终渲染:对草稿满意后,将场景以 1080p 重新渲染,输出一段精致的 10 秒 MP4,并带有原生 48kHz 立体声音频 [8]。
"The consistency of WAN 2.6 is amazing! Character images remain stable across multiple clips, which was previously hard to achieve." - Wei Zhang, Independent Animator [7]
想在最终渲染时额外提升效果,可使用 enable_prompt_expansion 参数。该功能会自动为你的提示词丰富电影级细节,在无需额外手动调整的情况下提升输出质量 [12][3]。
结语与后续步骤
现在,你已经具备了投入创作首个 Wan 2.5 视频所需的工具。凭借其内置的一次生成音画同步、最高 1080p 分辨率的支持,以及文本生成视频、图像生成视频等多样的输入模式,这个模型已经足以胜任严肃的生产工作——而不仅仅是随意尝鲜。
在动手之前,请确保你的配置已完全就绪。从测试一段 480p 片段开始,微调你的提示词。掌握流程之后,再升级到 1080p 做最终渲染。这种方式让你能够在不预先投入过多资源的情况下进行试验和打磨。
对于你的第一个项目,不妨聚焦于单个场景。写一段包含清晰音频指令的详细提示词,生成一小段 5 秒片段。处理时间很快——通常在 1 到 5 分钟之间——成本也可控,480p 片段每秒仅 $0.0336 起 [6]。这是一种实惠的方式,让你探索并熟悉这款工具。
准备扩展时,可以充分利用 APIMart 超过 500 个 AI 模型的资源库。凭借单一的 API key 和计费面板,你可以简化工作流,轻松构建一整套脚本到视频的管线,或探索像 MiniMax-Hailuo 2.3 这样以高质量一致性见长的替代方案。
常见问题
对于长时间运行的视频任务,我该如何处理轮询和超时?
对于生产工作流,在创建任务时使用 callbackUrl 参数会更高效。这样,任务完成后你会自动收到一个 POST 请求。
如果你更喜欢轮询,方法如下:提交任务以获取 taskId,然后等待 50 秒再查询状态端点。此后,每 5 秒检查一次状态。为避免系统过载,请务必处理 429 错误,做法是暂停并在延迟后重试。
在生成 5 秒或 10 秒片段之前,估算成本的最佳方法是什么?
要计算 5 秒或 10 秒视频片段的成本,只需将片段时长(以秒计)乘以服务商的每秒费率。请务必查看你想要的分辨率对应的费率——无论是 480p、720p 还是 1080p——因为更高的质量通常伴随更高的价格。例如,计算 5 秒片段时,将每秒费率乘以 5;计算 10 秒片段时,则乘以 10。
我如何通过提示词提升对口型和对白质量?
要在 Wan 2.5 Preview 中获得最佳的对口型和对白质量,请使用结构化提示词。它们应清晰地指明角色的台词,以及情绪、语气、语速 和 音色 等细节。这种细致程度有助于模型给出更准确、更自然的结果。
若想获得更高的精度,你可以上传一个 WAV 或 MP3 格式的自定义音频文件。这个文件会作为引导,帮助模型将面部表情和口型与音频完美对齐。
请确保你的输入图像清晰 且 光照良好。高质量的图像能确保模型有效地解读和还原表情。此外,善用提示词扩展功能,它允许你加入详细描述,供模型更好地理解。
去模型市场挑选你想要的模型
在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。