
Wan 2.5 Preview の始め方
開発者向けの Wan 2.5 Preview 入門ガイド。API のセットアップ、映画的な T2V・I2V プロンプトの書き方、音声同期の追加、1080p 動画のコスト管理までを解説します。
Wan 2.5 Preview は、Alibaba が開発した動画生成ツールで、テキストによる説明や画像を、音声が同期した短い映画的なクリップに変換します。テキスト・トゥ・ビデオ(T2V)と画像・トゥ・ビデオ(I2V)の 2 つのモードに対応しています。Kling V3 などの他の高性能モデルも、同様の映画的な機能を提供しています。主な特長は、ワンパスでの音声と映像の同時生成、正確なリップシンク、そして 5 秒または 10 秒の動画を最大 1080p・24fps で出力できる点です。統合は、シームレスなアクセスのための統一 API を提供するプラットフォーム APIMart を通じて簡単に行えます。料金は 480p で 1 秒あたり $0.0336 から始まります。始めるにあたって知っておくべきことは次のとおりです。
- モード: テキストプロンプトから動画を作成する T2V、画像に動きを加える I2V。
- 品質: 48kHz ステレオ音声付きで 480p、720p、または 1080p での出力。
- 料金: 従量課金制で、生成した動画の 1 秒ごとに課金。
- セットアップ: REST API を使って Python または Node.js で動作。APIMart の API キーが必要。
- ワークフロー: リクエストを送信し、タスク ID を取得して、結果をポーリングで待つ。
まずは 5 秒・480p のクリップでセットアップをテストしましょう。慣れてきたら、最終レンダリングでは 1080p にスケールアップします。より良い結果を得るために詳細なプロンプトを使い、同期した音声のために音声指示を組み込みましょう。
このガイドでは、環境のセットアップからプロンプトの作成、そして効果的なコスト管理まで、すべてを網羅します。
環境のセットアップ
開発者の前提知識
コードに取りかかる前に、いくつかの基礎を理解しておくことが重要です。Wan 2.5 とのやり取りはすべてこれらの標準に依存しているため、REST API と JSON フォーマットをしっかりと把握しておく必要があります。Python 3.x でも **Node.js(v14 以降)**でも、このセットアップにはどちらでも対応できます。
もう 1 つ理解しておくべき重要な概念が、非同期ワークフローです。Wan 2.5 は完成した動画をすぐに返すわけではありません。代わりに、監視する必要のある task_id を返します。タスクのステータスが「completed」に更新されるまで確認するポーリングループを作成する必要があります。準備ができたら、APIMart にアクセスしてアカウントを作成し、API キーを取得しましょう。
APIMart アカウントと API キーの作成

まずは apimart.ai にアクセスして無料アカウントを作成します。サインイン後、コンソールダッシュボードの API Key Management セクションに移動して API キーを生成します。キーは一度しか表示されないため、すぐにコピーして安全に保管してください。
APIMart は従量課金モデルを採用しているため、リクエストを行う前にアカウントに入金しておく必要があります。402 エラーが発生した場合は、アカウント残高が不足していることを意味します。一方で 401 エラーは、API キーに問題があることを示します。認証情報を再確認し、アカウントに十分な残高があることを確認してください。
開発環境の設定
API キーが用意できれば、環境のセットアップは簡単です。APIMart は OpenAI SDK と互換性があります。始めるには次のようにします。
- Python の場合:
pip install openaiを実行 - Node.js の場合:
npm install openaiを実行
標準の OpenAI セットアップからの唯一の変更点は、ベース URL です。次のように設定します。
https://api.apimart.ai/v1
リクエストの認証は、次のようにヘッダーに Bearer トークンとして API キーを含めることで行います。
Authorization: Bearer YOUR_API_KEY
セキュリティを高めるため、API キーをスクリプトに直接ハードコーディングするのは避けましょう。代わりに、環境変数に保存します。ローカル開発中に .env ファイルを使用することは、認証情報を安全に保ち、バージョン管理から除外するための良い習慣です。環境の設定が完了したら、最初の API リクエストに進むことができます。
最初の API リクエストを行う
テキスト・トゥ・ビデオのリクエスト例
セットアップが完了したら、最初の API リクエストに取りかかりましょう。前述のとおり、これらのリクエストは非同期であるため、結果を得る前にタスクの完了を待つ必要があります。
テキスト・トゥ・ビデオの出力を生成し始めるための、シンプルな Python の例を次に示します。
import openai
import os
client = openai.OpenAI(
api_key=os.environ["APIMART_API_KEY"],
base_url="https://api.apimart.ai/v1"
)
response = client.post("/wan2.5-t2v-preview", json={
"model": "wan2.5-t2v-preview",
"input": {
"prompt": "A golden retriever runs along a sunlit beach, waves crashing in slow motion",
"negative_prompt": "low quality, blurry, distorted",
"duration": 5,
"size": "1280*720",
"prompt_extend": True
}
})
task_id = response.json()["task_id"]
print(f"Task started: {task_id}")
ここで唯一必須のフィールドは prompt で、作成したいシーンを記述します。negative_prompt や size などの他のパラメータは、出力を調整するのに役立ちます。プロンプトが短い場合は、prompt_extend を true に設定すると、モデルがそれをより詳細で映画的な説明へと拡張できます。アスペクト比ではなく、1280*720 のような正確な寸法を使用することを忘れないでください。
リクエストを送信すると、task_id を受け取ります。この ID を使って、タスクが SUCCEEDED とマークされるまでステータスエンドポイントをポーリングします。
import time
while True:
result = client.get(f"/tasks/{task_id}")
status = result.json()["task_status"]
if status == "SUCCEEDED":
video_url = result.json()["video_url"]
print(f"Video ready: {video_url}")
break
elif status == "FAILED":
print("Generation failed.")
break
time.sleep(15)
動画の生成には通常 1〜5 分かかります。動画の準備ができたら、URL はその後に失効するため、24 時間以内にダウンロードしてください。
次に、同様のアプローチで画像から動画を生成する方法を見ていきましょう。異なる映画的スタイルを求めるなら、Grok Imagine Video などの他のモデルを試すこともできます。
画像・トゥ・ビデオのリクエスト例
画像・トゥ・ビデオ(I2V)のプロセスは同じ非同期ワークフローに従いますが、2 つの重要な違いがあります。wan2.5-i2v-preview モデルを指定し、ソース画像を指す image_url を提供する必要があるという点です。
例を次に示します。
response = client.post("/wan2.5-i2v-preview", json={
"model": "wan2.5-i2v-preview",
"input": {
"image_url": "https://your-storage.com/character-portrait.jpg",
"prompt": "The character slowly turns their head and smiles at the camera",
"duration": 5,
"resolution": "720p",
"negative_prompt": "blurry, artifacts"
}
})
I2V の場合、prompt は開始画像に対する動きや変化(キャラクターの動きやカメラの動作など)を記述する必要があります。アスペクト比はソース画像に合わせられるため、送信前に希望の比率(例: 16:9、9:16、1:1)にトリミングしておいてください。ソース画像は、いずれの辺も 360〜2,000 ピクセルの間で、10 MB 以下にする必要があります。
テキスト・トゥ・ビデオと同様に、レスポンスから task_id を取得し、同じポーリングロジックを使ってタスクが完了するまでステータスを追跡します。
それでは、各フィールドが何を意味するのかを理解するために、API レスポンスの構造を分解してみましょう。
API レスポンスの理解
POST リクエストが成功すると、API はタスクの進行状況を確認するために使える task_id を含む JSON オブジェクトを返します。タスクが完了すると、次のフィールドを受け取ります。
| フィールド | 型 | 説明 |
|---|---|---|
task_id / id | String | タスクの一意の識別子。 |
task_status | Enum | タスクの現在のステータス: PENDING、RUNNING、SUCCEEDED、または FAILED。 |
video_url | String | 生成された MP4 動画への直接リンク。 |
meta.usage | Object | credits_used などのリソース使用量に関する詳細。 |
error | Object | タスクが失敗した場合、エラーの詳細を含む name と message が入る。 |
200 の HTTP ステータスコードと有効な task_id は、リクエストが受け付けられたことを意味します。タスクが最終的に失敗した場合は、error.message フィールドで、サポートされていない解像度フォーマットやプロンプトが長すぎるといった詳細を確認してください。
Wan 2.5 (the Veo 3 Killer) is NOW in n8n (full tutorial & template)
プロンプトと設定の最適化
環境をセットアップして最初の API リクエストを行ったら(あるいは新しい WAN 2.6 API を試したら)、プロンプトを微調整することで動画出力の品質を大きく向上させることができます。
優れたテキストと画像のプロンプトを書く
得られる結果は、プロンプトの作り込みの質に大きく左右されます。Wan 2.5 の場合、80〜120 語のプロンプトが最も効果的です。明確な指示を与えられるだけの長さがありながら、モデルを混乱させるほど長くはないためです。
従うべき有用な構成は次のとおりです。まず被写体やシーンから始め、次にカメラの動き、動きの詳細、ビジュアルスタイルを加えていきます。たとえば、「都市を歩く女性」 と言う代わりに、次のように書くことができます。「A woman in a red coat walks briskly through a rain-soaked Manhattan street at dusk. Dolly in slowly. Puddles reflect neon signs. Teal-and-orange color grade, anamorphic bokeh, volumetric dusk lighting.」 このレベルの詳細さは、雰囲気、構図、動きについてモデルに明確な指示を与えます。
カメラを制御するには、Pan left/right、Tilt up/down、Dolly in/out、Orbital arc、Crane up/down といった標準的な撮影用語を使います。視差効果を描写することで奥行きを加えましょう。「foreground grass sways while mountains remain still in the background.」 また、「slow-motion」 や 「whip-pan(素早いカメラのパン)」 といった用語でテンポを調整することもできます。
画像・トゥ・ビデオのタスクでは、モデルが提供された画像を基準として使用するため、動きや表情の変化を描写することに集中してください。
ビジュアルプロンプトが固まったら、同期した音声やセリフを組み込むことで、さらに一歩進めることができます。
音声とセリフの追加
Wan 2.5 の際立った特長の 1 つは、動画と音声を同時に生成できる能力であり、音声、環境音、効果音を伴った完全に同期した体験を生み出します。
"What truly sets Wan 2.5 apart is its ability to generate not just silent videos, but complete audio-visual experiences in a single pass." - Scenario Knowledge Base [9]
リップシンクしたセリフには、次のようにキャラクターの発話を引用符で囲んで含めます。"A scientist looks into the camera and says, 'The results are extraordinary.'" 環境音については具体的に記述しましょう。"rain taps against a window, distant traffic hums." モデルはこれらの詳細を自動的に最終出力に統合します。
独自の音声を使いたい場合は、.wav または .mp3 形式でカスタムの audio_url(最大サイズ: 15 MB)を提供できます。ただし、音声ファイルは動画の長さに合わせる必要があります。短い場合は、残りのフレームは無音になります。1 つのリクエストで audio_url を複数の画像や動画の URL と組み合わせると、競合を招く可能性があるため注意してください [4]。
モデルは音声の言語をプロンプトに自動的に合わせるため、プロンプトが英語であれば音声も英語になり、追加の手順は不要です [10]。
このレベルの同期により、音声と映像がシームレスに連携し、洗練された最終結果が得られます。
解像度と長さの選択
API リクエストを扱う際、適切な解像度と長さを選ぶことは、品質とコストのバランスを取るうえで鍵となります。
Wan 2.5 Preview は 2 つの固定された長さ(5 秒または 10 秒)と、24 fps での 480p、720p、1080p の解像度を提供します。まずは 480p の 5 秒のドラフトでコンセプトをテストし、その後、最終レンダリングで 1080p にスケールアップしましょう。
一般的なユースケースの簡単な参考表を次に示します。
| ユースケース | アスペクト比 | 推奨解像度 | 長さ |
|---|---|---|---|
| YouTube / プレゼンテーション | 16:9 (1920×1080) | 1080p | 10s |
| TikTok / Reels / Shorts | 9:16 (1080×1920) | 1080p | 5–10s |
| Instagram フィード / 正方形広告 | 1:1 (1440×1440) | 1080p | 5s |
| プロトタイピング / テスト | Any | 480p | 5s |
| タブレット / クラシックディスプレイ | 4:3 (1632×1248) | 720p | 5–10s |
すべての解像度に 48kHz ステレオ音声が含まれるため、低解像度のドラフトであっても、高品質なレンダリングに踏み切る前に音声の仕上がりを十分に把握できます。
Wan 2.5 をマルチモーダルワークフローに統合する

API の実験を一通り試したら、Wan 2.5 を本番パイプラインに統合する番です。APIMart を使えば、単一の API を通じて 500 を超える AI モデルにアクセスできます。このセットアップにより、追加の設定なしで言語、画像、動画のモデルをシームレスに組み合わせることができます。
スクリプト・トゥ・ビデオのパイプライン構築
一般的なワークフローは次のとおりです。まず言語モデルでスクリプトを起草し、シーンに分割します。次に、画像生成モデルを使って各シーンのストーリーボードを作成します。そこから Wan 2.5 が登場し、ストーリーボードとシーンの説明を受け取って動画クリップを生成します。しかも音声も一度に同期させるため、プロセスを簡素化します [2][5]。
すべてを APIMart 内で完結させることで、ワークフローを効率化できます。管理が必要なのは 1 つの API 構造、1 つの認証キー、1 つの請求ダッシュボードだけです。このセットアップにより、パフォーマンスとコストのバランスの微調整に集中できます。
コストとパフォーマンスの管理
コストを効果的に管理するには、プロジェクトの現在の段階に合わせてモデルと解像度を調整します。初期ドラフトには 480p 解像度で 5 秒のクリップを使い、これはクリップあたり 43 クレジットのコストです。ドラフトが承認されたら、720p にアップグレードし、5 秒で 85 クレジット、または 10 秒で 170 クレジットになります。最終レンダリングでは 1080p に上げ、5 秒で 128 クレジット、または 10 秒で 255 クレジットとなります [1]。
より速い反復が必要ですか? wan-2.5-fast バリアントは 1080p 向けにより費用対効果の高い選択肢を提供し、10 秒のクリップのコストを 255 クレジットではなく 174 クレジットに削減します [11]。画像・トゥ・ビデオのタスクを大規模に扱う場合、wan2.6-i2v-flash モデルは予算に優しい選択肢で、標準の Wan 2.6 の 1 秒あたり $0.05 に対し、720p で 1 秒あたり $0.0168 を課金します [7]。
ワークフロー例: コンセプトから最終動画まで
コストとパフォーマンスを最適化したら、コンセプトを形にするために次のステップバイステップのプロセスに従いましょう。
- スクリプトを書く: GPT-5(APIMart 経由で利用可能)などの言語モデルを使って、詳細なシーンの説明を作成します。「soft piano music fades in」や「distant city traffic hums」といった具体的な音声のキューを含めましょう。
- ストーリーボードを生成し、480p でシーンをドラフト: シーンの説明を画像モデルに入力してビジュアルガイドを作成します。次に、Wan 2.5 で各シーンを 480p・5 秒でテストし、動き、テンポ、音声同期を評価します。
- 1080p で最終レンダリング: ドラフトに満足したら、シーンを 1080p で再レンダリングし、ネイティブの 48kHz ステレオ音声を備えた洗練された 10 秒の MP4 出力を得ます [8]。
"The consistency of WAN 2.6 is amazing! Character images remain stable across multiple clips, which was previously hard to achieve." - Wei Zhang, Independent Animator [7]
最終レンダリング時にさらにひと押しするには、enable_prompt_expansion パラメータを使いましょう。この機能は、追加の手動調整を必要とせずに、映画的なディテールでプロンプトを自動的に豊かにし、出力の品質を高めます [12][3]。
まとめと次のステップ
これで、最初の Wan 2.5 動画の作成に取りかかるためのツールが揃いました。ワンパスでの音声・映像同期を内蔵し、最大 1080p までの解像度をサポートし、テキスト・トゥ・ビデオや画像・トゥ・ビデオといった多彩な入力モードを備えたこのモデルは、単なるお試しではなく本格的な制作作業に対応できます。
取りかかる前に、セットアップが完全に整っていることを確認しましょう。まずは 480p のクリップをテストしてプロンプトを微調整するところから小さく始めます。プロセスを習得したら、最終レンダリングで 1080p にスケールアップします。このアプローチにより、最初から多くのリソースを投入することなく、実験と改善が可能になります。
最初のプロジェクトでは、単一のシーンに集中してみましょう。明確な音声指示を含む詳細なプロンプトを書き、短い 5 秒のクリップを生成します。処理時間は速く、通常 1〜5 分程度で、コストも管理しやすく、480p クリップなら 1 秒あたりわずか $0.0336 から始まります [6]。手頃な価格でツールを探索し、使い慣れることができます。
拡張する準備ができたら、500 を超える AI モデルからなる APIMart のライブラリを活用しましょう。1 つの API キーと請求ダッシュボードで、ワークフローを効率化して完全なスクリプト・トゥ・ビデオのパイプラインを簡単に構築でき、あるいは高品質な一貫性を求めるなら MiniMax-Hailuo 2.3 のような代替手段を検討することもできます。
よくある質問
長時間実行される動画タスクのポーリングとタイムアウトはどう扱えばよいですか?
本番ワークフローでは、タスク作成時に callbackUrl パラメータを使うのが効率的です。こうすると、タスクが完了した時点で自動的に POST リクエストを受け取れます。
ポーリングを使いたい場合の流れは次のとおりです。タスクを送信して taskId を取得し、ステータスエンドポイントに問い合わせる前に 50 秒待ちます。その後、5 秒ごとにステータスを確認します。システムへの過負荷を防ぐため、429 エラーが発生した場合は、一定時間待ってから再試行するように対応してください。
5 秒または 10 秒のクリップを生成する前にコストを見積もる最適な方法は?
5 秒または 10 秒の動画クリップのコストを算出するには、クリップの長さ(秒単位)にプロバイダーの 1 秒あたりの料金を掛けるだけです。480p、720p、1080p のいずれであっても、希望する解像度の料金を必ず確認してください。高品質になるほど価格も高くなるのが一般的です。たとえば、5 秒のクリップを計算する場合は、1 秒あたりの料金に 5 を掛けます。10 秒のクリップの場合は 10 を掛けます。
プロンプトでリップシンクとセリフの品質を向上させるには?
Wan 2.5 Preview で最高のリップシンクとセリフの品質を得るには、構造化されたプロンプトを使いましょう。キャラクターのセリフに加えて、感情、トーン、速度、音色といった詳細を明確に指定する必要があります。このレベルの詳細さは、モデルがより正確で自然な結果を出すのに役立ちます。
さらに高い精度を求めるなら、WAV または MP3 形式でカスタム音声ファイルをアップロードできます。このファイルは、表情や口の動きを音声に完璧に合わせるためのガイドとしてモデルが利用します。
入力画像は鮮明で十分に明るいものにしてください。高品質な画像は、モデルが表情を効果的に解釈・再現できるようにします。さらに、プロンプト拡張機能を活用しましょう。これにより、モデルがより適切に解釈できるよう詳細な説明を含めることができます。
モデルマーケットで使いたいモデルを選ぶ
APIMart のモデルマーケットでチャット、画像、動画モデルを試し、統一 API でモデルの能力をすばやく体験できます。