
Как начать работу с Wan 2.5 Preview
Краткое руководство по Wan 2.5 Preview для разработчиков: настройте API, пишите кинематографичные промпты T2V и I2V, добавляйте синхронное аудио и контролируйте стоимость видео 1080p.
Wan 2.5 Preview — это инструмент генерации видео от Alibaba, который превращает текстовые описания или изображения в короткие кинематографичные клипы с синхронизированным аудио. Он поддерживает два режима: text-to-video (T2V) и image-to-video (I2V). Другие высокопроизводительные модели, такие как Kling V3, предлагают схожие кинематографичные возможности. Ключевые особенности включают создание аудиовизуального контента за один проход, точную синхронизацию губ и вывод до 1080p при 24 fps для видео длительностью 5 или 10 секунд. Интеграция упрощена благодаря APIMart — платформе, предлагающей единый API для беспрепятственного доступа. Цены начинаются от $0.0336/секунду для 480p. Вот что нужно знать, чтобы начать:
- Режимы: T2V для создания видео из текстовых промптов, I2V для добавления движения к изображениям.
- Качество: Вывод в 480p, 720p или 1080p с 48kHz стереозвуком.
- Цены: Оплата по факту использования, тарификация за секунду сгенерированного видео.
- Настройка: Работает с Python или Node.js через REST API. Требуется API-ключ от APIMart.
- Рабочий процесс: Отправьте запрос, получите task ID и опрашивайте статус для получения результата.
Начните с 5-секундного клипа в 480p, чтобы проверить настройку. Освоившись, переходите к 1080p для финального рендера. Используйте подробные промпты для лучших результатов и добавляйте инструкции для аудио, чтобы получить синхронный звук.
Это руководство охватывает всё — от настройки окружения до создания промптов и эффективного управления затратами.
Настройка окружения
Что нужно знать разработчику
Прежде чем погрузиться в код, важно освоить некоторые основы. Вы должны хорошо понимать REST API и форматирование JSON, так как всё взаимодействие с Wan 2.5 опирается на эти стандарты. Подойдёт как Python 3.x, так и Node.js (v14+) — оба варианта работают для этой настройки.
Ещё одна ключевая концепция, которую нужно понять, — асинхронные рабочие процессы. Wan 2.5 не выдаёт готовое видео сразу. Вместо этого он предоставляет task_id, который вам нужно будет отслеживать. Вам придётся создать цикл опроса, чтобы проверять статус задачи, пока он не изменится на «completed». Когда будете готовы, перейдите на APIMart, чтобы создать аккаунт и получить свой API-ключ.
Создание аккаунта APIMart и API-ключа

Начните с посещения apimart.ai, чтобы создать бесплатный аккаунт. После входа перейдите в раздел API Key Management в вашей консоли, чтобы сгенерировать API-ключ. Обязательно сразу скопируйте и надёжно сохраните ключ — он отображается только один раз.
APIMart использует модель оплаты по факту использования, поэтому перед выполнением запросов нужно пополнить счёт. Если вы получаете ошибку 402, это значит, что баланс аккаунта слишком мал. Ошибка 401, напротив, указывает на проблему с вашим API-ключом. Перепроверьте учётные данные и убедитесь, что на аккаунте достаточно средств.
Настройка среды разработки
Когда API-ключ готов, настройка окружения проста. APIMart совместим с OpenAI SDK. Чтобы начать:
- Для Python: Выполните
pip install openai - Для Node.js: Выполните
npm install openai
Единственное отличие от стандартной настройки OpenAI — это base URL. Задайте его так:
https://api.apimart.ai/v1
Аутентифицируйте свои запросы, добавляя API-ключ как Bearer-токен в заголовок, вот так:
Authorization: Bearer YOUR_API_KEY
Для дополнительной безопасности не прописывайте API-ключ напрямую в скриптах. Вместо этого храните его в переменной окружения. Использование файла .env во время локальной разработки — хорошая практика, позволяющая уберечь учётные данные и не помещать их в систему контроля версий. После настройки окружения можно переходить к первым API-запросам.
Первые API-запросы
Пример запроса Text-to-Video
Когда всё настроено, можно приступать к первому API-запросу! Как упоминалось ранее, эти запросы асинхронные, то есть вам нужно будет дождаться завершения задачи, прежде чем получить результат.
Вот простой пример на Python для начала генерации text-to-video:
import openai
import os
client = openai.OpenAI(
api_key=os.environ["APIMART_API_KEY"],
base_url="https://api.apimart.ai/v1"
)
response = client.post("/wan2.5-t2v-preview", json={
"model": "wan2.5-t2v-preview",
"input": {
"prompt": "A golden retriever runs along a sunlit beach, waves crashing in slow motion",
"negative_prompt": "low quality, blurry, distorted",
"duration": 5,
"size": "1280*720",
"prompt_extend": True
}
})
task_id = response.json()["task_id"]
print(f"Task started: {task_id}")
Единственное обязательное поле здесь — prompt, описывающий сцену, которую вы хотите создать. Другие параметры, такие как negative_prompt и size, помогают уточнить вывод. Если промпт короткий, установка prompt_extend в true позволяет модели развернуть его в более подробное, кинематографичное описание. Помните, что нужно указывать точные размеры, например 1280*720, а не соотношения сторон.
После отправки запроса вы получите task_id. Используйте этот ID для опроса эндпоинта статуса, пока задача не будет помечена как SUCCEEDED:
import time
while True:
result = client.get(f"/tasks/{task_id}")
status = result.json()["task_status"]
if status == "SUCCEEDED":
video_url = result.json()["video_url"]
print(f"Video ready: {video_url}")
break
elif status == "FAILED":
print("Generation failed.")
break
time.sleep(15)
Генерация видео обычно занимает 1–5 минут. Как только видео готово, скачайте его в течение 24 часов, так как после этого URL перестанет действовать.
Далее рассмотрим, как генерировать видео из изображений схожим способом. Вы также можете изучить другие модели, например Grok Imagine Video, для различных кинематографичных стилей.
Пример запроса Image-to-Video
Процесс image-to-video (I2V) следует тому же асинхронному рабочему процессу, но включает два ключевых отличия: нужно указать модель wan2.5-i2v-preview и предоставить image_url со ссылкой на исходное изображение.
Вот пример:
response = client.post("/wan2.5-i2v-preview", json={
"model": "wan2.5-i2v-preview",
"input": {
"image_url": "https://your-storage.com/character-portrait.jpg",
"prompt": "The character slowly turns their head and smiles at the camera",
"duration": 5,
"resolution": "720p",
"negative_prompt": "blurry, artifacts"
}
})
Для I2V prompt должен описывать движение или изменения относительно исходного изображения — например, движения персонажа или действия камеры. Соотношение сторон будет совпадать с исходным изображением, поэтому убедитесь, что оно обрезано до нужного соотношения (например, 16:9, 9:16, 1:1) перед отправкой. Исходные изображения должны быть от 360 до 2000 пикселей по каждой стороне и не превышать 10 МБ.
Как и в случае с text-to-video, получите task_id из ответа и используйте ту же логику опроса, чтобы отслеживать статус задачи до её завершения.
Теперь разберём структуру ответов API, чтобы понять, что означает каждое поле.
Понимание ответов API
Когда вы делаете успешный POST-запрос, API возвращает JSON-объект, содержащий task_id, который можно использовать для проверки прогресса задачи. После завершения задачи вы получите следующие поля:
| Поле | Тип | Описание |
|---|---|---|
task_id / id | String | Уникальный идентификатор задачи. |
task_status | Enum | Текущий статус задачи: PENDING, RUNNING, SUCCEEDED или FAILED. |
video_url | String | Прямая ссылка на сгенерированное MP4-видео. |
meta.usage | Object | Сведения об использовании ресурсов, например credits_used. |
error | Object | Если задача не выполнена, содержит name и message с деталями ошибки. |
HTTP-код 200 и корректный task_id означают, что запрос принят. Если задача в итоге завершится неудачей, проверьте поле error.message для получения деталей, таких как неподдерживаемые форматы разрешения или слишком длинный промпт.
Wan 2.5 (the Veo 3 Killer) is NOW in n8n (full tutorial & template)
Оптимизация промптов и конфигураций
Когда окружение настроено и вы сделали первые API-запросы (или изучили более новый WAN 2.6 API), тонкая настройка промптов может значительно улучшить качество ваших видео.
Как писать хорошие текстовые и графические промпты
Результаты сильно зависят от того, насколько хорошо вы составите промпты. Для Wan 2.5 лучше всего работают промпты длиной от 80 до 120 слов — достаточно длинные, чтобы дать чёткие указания, но не настолько, чтобы запутать модель.
Вот полезная структура для следования: начните с субъекта или сцены, затем добавьте движения камеры, детали движения и визуальный стиль. Например, вместо «a woman walking in a city» можно написать: «A woman in a red coat walks briskly through a rain-soaked Manhattan street at dusk. Dolly in slowly. Puddles reflect neon signs. Teal-and-orange color grade, anamorphic bokeh, volumetric dusk lighting.» Такой уровень детализации даёт модели чёткие указания по настроению, композиции и движению.
Чтобы управлять камерой, используйте стандартные операторские термины, такие как Pan left/right, Tilt up/down, Dolly in/out, Orbital arc или Crane up/down. Добавьте глубину, описывая эффекты параллакса — «foreground grass sways while mountains remain still in the background.» Также можно регулировать темп терминами вроде «slow-motion» или «whip-pan (a quick camera pan).»
Для задач image-to-video сосредоточьтесь на описании движения или изменений выражения, поскольку модель использует предоставленное изображение как базовую основу.
Когда визуальный промпт зафиксирован, можно сделать ещё один шаг вперёд, добавив синхронизированное аудио и диалоги.
Добавление аудио и диалогов
Одна из выдающихся особенностей Wan 2.5 — способность генерировать видео и аудио одновременно, создавая полностью синхронизированный результат с голосом, окружающими звуками и эффектами.
«What truly sets Wan 2.5 apart is its ability to generate not just silent videos, but complete audio-visual experiences in a single pass.» — Scenario Knowledge Base [9]
Для диалогов с синхронизацией губ включайте речь персонажа в кавычках, вот так: «A scientist looks into the camera and says, 'The results are extraordinary.'» Для звуков окружения будьте конкретны: «rain taps against a window, distant traffic hums.» Модель автоматически интегрирует эти детали в итоговый результат.
Если хотите использовать собственное аудио, можно указать пользовательский audio_url в формате .wav или .mp3 (макс. размер: 15 МБ). Однако аудиофайл должен соответствовать длительности видео; если он короче, оставшиеся кадры будут беззвучными. Будьте осторожны при сочетании audio_url с несколькими URL изображений или видео в одном запросе, так как это может привести к конфликтам [4].
Модель автоматически подбирает язык аудио под ваш промпт, поэтому если промпт на английском, аудио тоже будет на английском — без дополнительных действий [10].
Такой уровень синхронизации гарантирует, что аудио и видео работают вместе безупречно, обеспечивая отточенный итоговый результат.
Выбор разрешения и длительности
При работе с API-запросами выбор правильного разрешения и длительности играет ключевую роль в балансе между качеством и стоимостью.
Wan 2.5 Preview предлагает две фиксированные длительности — 5 секунд или 10 секунд — и разрешения 480p, 720p и 1080p при 24 fps. Начните с 5-секундного черновика в 480p для проверки концепции, затем переходите к 1080p для финального рендера.
Вот краткая справка для распространённых сценариев использования:
| Сценарий использования | Соотношение сторон | Рекомендуемое разрешение | Длительность |
|---|---|---|---|
| YouTube / Презентации | 16:9 (1920×1080) | 1080p | 10s |
| TikTok / Reels / Shorts | 9:16 (1080×1920) | 1080p | 5–10s |
| Лента Instagram / Квадратная реклама | 1:1 (1440×1440) | 1080p | 5s |
| Прототипирование / Тестирование | Любое | 480p | 5s |
| Планшет / Классический дисплей | 4:3 (1632×1248) | 720p | 5–10s |
Все разрешения включают 48kHz стереозвук, поэтому даже черновик в низком разрешении даст хорошее представление о том, как будет звучать аудио, прежде чем вы приступите к рендеру более высокого качества.
Интеграция Wan 2.5 в мультимодальные рабочие процессы

Поэкспериментировав с API, пора интегрировать Wan 2.5 в ваш продакшн-конвейер. С APIMart вы получаете доступ к более чем 500 моделям ИИ через один API. Такая настройка позволяет беспрепятственно комбинировать языковые, графические и видеомодели без дополнительной конфигурации.
Построение конвейера «сценарий-в-видео»
Вот распространённый рабочий процесс: начните с языковой модели, чтобы составить сценарий и разбить его на сцены. Затем используйте модель генерации изображений, чтобы создать раскадровку для каждой сцены. После этого в дело вступает Wan 2.5, принимая раскадровку и описания сцен для создания видеоклипа. Он даже синхронизирует аудио за один проход, упрощая процесс [2][5].
Держа всё в рамках APIMart, вы упрощаете свой рабочий процесс. Вам нужно будет управлять только одной структурой API, одним ключом аутентификации и единой панелью биллинга. С такой настройкой можно сосредоточиться на тонкой настройке баланса между производительностью и стоимостью.
Управление затратами и производительностью
Чтобы эффективно управлять расходами, подбирайте модель и разрешение под текущий этап проекта. Для ранних черновиков используйте разрешение 480p для 5-секундных клипов, что стоит 43 кредита за клип. После утверждения черновика переходите на 720p за 85 кредитов для 5 секунд или 170 кредитов для 10 секунд. Для финального рендера повышайте до 1080p за 128 кредитов для 5 секунд или 255 кредитов для 10 секунд [1].
Нужны более быстрые итерации? Вариант wan-2.5-fast предлагает более экономичный вариант для 1080p, снижая стоимость 10-секундного клипа до 174 кредитов вместо 255 кредитов [11]. Если вы решаете задачи image-to-video в большом объёме, модель wan2.6-i2v-flash — бюджетный выбор, стоимостью $0.0168 за секунду при 720p против $0.05 за секунду для стандартного Wan 2.6 [7].
Пример рабочего процесса: от концепции до финального видео
Оптимизировав затраты и производительность, следуйте этому пошаговому процессу, чтобы воплотить свою концепцию в жизнь:
- Напишите сценарий: Используйте языковую модель вроде GPT-5 (доступна через APIMart), чтобы создать подробные описания сцен. Включите конкретные аудиоподсказки, например «soft piano music fades in» или «distant city traffic hums».
- Создайте раскадровки и черновые сцены в 480p: Подайте описания сцен в графическую модель, чтобы создать визуальные ориентиры. Затем протестируйте каждую сцену с Wan 2.5 в 480p по 5 секунд, чтобы оценить движение, темп и синхронизацию аудио.
- Финальный рендер в 1080p: Убедившись в качестве черновиков, повторно отрендерьте сцены в 1080p, получив отточенный 10-секундный MP4-вывод с нативным 48kHz стереозвуком [8].
«The consistency of WAN 2.6 is amazing! Character images remain stable across multiple clips, which was previously hard to achieve.» — Wei Zhang, Independent Animator [7]
Для дополнительного эффекта во время финального рендера используйте параметр enable_prompt_expansion. Эта функция автоматически обогащает ваши промпты кинематографичными деталями, повышая качество вывода без дополнительных ручных настроек [12][3].
Заключение и дальнейшие шаги
Теперь у вас есть всё необходимое, чтобы приступить к созданию своего первого видео Wan 2.5. Со встроенной аудиовидеосинхронизацией за один проход, поддержкой разрешений до 1080p и универсальными режимами ввода вроде text-to-video и image-to-video, эта модель готова к серьёзной продакшн-работе — а не только к пробным экспериментам.
Прежде чем приступить, убедитесь, что настройка полностью готова. Начните с малого, протестировав клип в 480p, чтобы отточить промпты. Освоив процесс, переходите к 1080p для финального рендера. Такой подход позволяет экспериментировать и совершенствоваться, не расходуя слишком много ресурсов сразу.
Для первого проекта попробуйте сосредоточиться на одной сцене. Напишите подробный промпт с чёткими инструкциями для аудио и сгенерируйте короткий 5-секундный клип. Время обработки невелико — обычно от 1 до 5 минут — а стоимость управляема, начиная всего от $0.0336 за секунду для клипов в 480p [6]. Это доступный способ изучить инструмент и освоиться с ним.
Когда будете готовы расширяться, воспользуйтесь библиотекой APIMart из более чем 500 моделей ИИ. С единым API-ключом и панелью биллинга можно упростить рабочий процесс и без труда создать полноценный конвейер «сценарий-в-видео» или изучить альтернативы вроде MiniMax-Hailuo 2.3 для высококачественной консистентности.
Часто задаваемые вопросы
Как обрабатывать опрос и таймауты для длительных задач генерации видео?
Для продакшн-процессов эффективно использовать параметр callbackUrl при создании задачи. Так вы автоматически получите POST-запрос после завершения задачи.
Если предпочитаете опрос, вот как это работает: отправьте задачу, чтобы получить taskId, затем подождите 50 секунд перед запросом к эндпоинту статуса. После этого проверяйте статус каждые 5 секунд. Чтобы не перегружать систему, обязательно обрабатывайте ошибки 429, делая паузу и повторяя запрос через задержку.
Как лучше всего оценить стоимость перед генерацией 5- или 10-секундного клипа?
Чтобы вычислить стоимость 5- или 10-секундного видеоклипа, просто умножьте длительность клипа (в секундах) на посекундный тариф провайдера. Обязательно уточните тариф для нужного разрешения — будь то 480p, 720p или 1080p — поскольку более высокое качество обычно стоит дороже. Например, при расчёте для 5-секундного клипа умножьте посекундный тариф на 5. Для 10-секундного клипа умножьте на 10.
Как улучшить синхронизацию губ и качество диалогов с помощью промптов?
Чтобы добиться наилучшей синхронизации губ и качества диалогов в Wan 2.5 Preview, используйте структурированные промпты. В них следует чётко указывать реплики персонажа, а также такие детали, как эмоция, тон, скорость и тембр. Такой уровень детализации помогает модели давать более точные и естественные результаты.
Для ещё большей точности можно загрузить пользовательский аудиофайл в формате WAV или MP3. Этот файл будет служить ориентиром для модели, чтобы идеально согласовать мимику и движения губ с аудио.
Убедитесь, что входное изображение чёткое и хорошо освещённое. Качественное изображение позволяет модели эффективно интерпретировать и воспроизводить выражения. Кроме того, воспользуйтесь функцией расширения промпта, которая позволяет включать подробные описания для лучшей интерпретации моделью.
Выберите нужную модель в маркетплейсе моделей
Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.