
MiniMax 新一代模型:发布与 API 预览
MiniMax Hailuo 2.3 可通过文字或图片生成 6-10 秒的电影级短片。了解其功能、提交-轮询-下载的 API 流程,以及 APIMart 上按秒计费的美元定价。
如果你想现在就试用 MiniMax Hailuo 2.3,简短的答案是: Standard 模型支持文本生成视频和图片生成视频,Fast 模型仅支持图片生成视频,输出为 768p 或 1080p 分辨率的 6 秒或 10 秒短片。Standard 定价约为每个 6 秒短片 0.28 美元起,Fast 约为 0.19 美元,配合简单的提交 → 轮询 → 下载的 API 流程。
如果只看最重要的部分,这次发布主要涉及四件事:
- 现在能做什么: 文本生成视频和图片生成视频
- 成本如何: 在 APIMart 上,根据模型和分辨率不同,每秒约 0.0248 到 0.072 美元
- 如何接入: 先调用
POST /video_generation,再通过GET /query/video_generation查询状态 - 最适合谁: 制作短广告、产品短片、讲解视频以及测试变体的团队
同时也存在一些明确的限制。Fast 不支持文本生成视频。 输入图片必须小于 20 MB,短边需大于 300 像素,且宽高比需在允许范围内。Standard 模型通常每个短片需要约 30 到 90 秒的生成时间,因此它更适合短视频任务,而非长篇剪辑。

Minimax Hailuo API 教程:克隆声音、AI 视频与音乐生成 + Make.com 自动化
快速对比
| 模型 | 输入类型 | 输出时长 | 分辨率 | 起始价格 | 最适合 |
|---|---|---|---|---|---|
| MiniMax-Hailuo-2.3 | 文本或图片 | 6 秒或 10 秒 | 768p、1080p | 每 6 秒短片 $0.28 | 成片、广告、产品视频 |
| MiniMax-Hailuo-2.3-Fast | 仅图片 | 6 秒或 10 秒 | 768p、1080p | 每 6 秒短片 $0.19 | 草稿、测试、批量输出 |
让我印象最深的是:这个模型很容易上手尝试,定价也容易估算,API 也很直观。所以,如果你在评估 Hailuo 2.3 是否适合你的工作流,真正的问题不是“我能不能用上它”,而是**“我想要更好的输出质量,还是更低的单片成本?”**
2. MiniMax Hailuo 2.3 首发都带来了什么
MiniMax Hailuo 2.3 是 MiniMax 面向短视频的电影级短片生成模型,专为流畅的动作、富有表现力的角色,以及紧扣提示词要求的输出而打造。
2.1 核心能力与支持的工作流
在模型层面,主要的选择在于 Standard 与 Fast 之间。
Standard Hailuo 2.3 同时支持文本生成视频和图片生成视频,能带来更好的动作一致性、更逼真的输出,以及更精细的风格控制。它通常每个短片需要约 30 到 90 秒的生成时间。[2][5][7]
Fast 仅支持图片生成视频。它更偏向速度和更低成本,但代价是牺牲一部分图像质量。[3]
播放帧率大约在电影级的 24 fps 左右,但这应被视为一个大致目标,而非固定规格。[3][7][8]
实际上,这个选择会立即影响三件事:
- 每个短片需要多长时间
- 输出效果有多精致
- 团队从提示词到成稿草案的速度有多快
2.2 动作、角色与风格方面的提升
相较于 Hailuo 02,最大的进步体现在角色动作与情绪表现上。
Hailuo 2.3 使用面部肌肉模拟技术来处理眉毛动作、眼神焦点变化、轻微头部倾斜等细微表情。它还使用 Global Identity VAE 让面部、发型和服装在帧与帧之间保持更高的稳定性。[1][4][9]
镜头运动的表现也更强。你可以使用像 [Pan left]、[Zoom in]、[Tracking shot] 这样的括号指令,模型在单个提示词中最多支持三个此类指令。除此之外,Hailuo 2.3 还新增了更多风格控制选项,支持动漫、水墨画和游戏 CG 美术风格的渲染效果。[1][4][6][9]
这意味着团队可以更精确地把控短片的观感。无论是角色特写、缓慢推近镜头,还是风格化的产品镜头,都不再是靠猜测,而更像是一项提示词写作的工作。
2.3 Hailuo 2.3 最适合的场景
Hailuo 2.3 最适合制作简短有力的短片。如果你需要更长的作品,更合理的做法是在这里生成各个镜头,再用常规剪辑软件将它们拼接起来。
| 工作流类型 | 优势 | 限制 | 最适合的使用场景 |
|---|---|---|---|
| 文本生成视频 | 提示词遵循度高,输出风格化 | 仅限 Standard 模型 | 社交短片、风格化预告片 |
| 图片生成视频 | 角色一致性好,源图细节稳定 | 需要高质量的源图片 | 产品旋转展示、电商广告 |
| Fast(仅图生视频) | 生成更快,成本更低 | 不支持文本生成视频;保真度较低 | 批量草稿、A/B 测试 |
当输出质量、风格方向和提示词细节最重要时,使用 Standard Hailuo 2.3,例如主打广告、预告片,或以角色为核心的场景。当速度和产量更重要时,切换到 Fast,尤其适用于变体测试或批量社交内容生产。
这些发布层面的差异,直接延续到了下一节中关于 API 配置、输出限制和集成决策的讨论。
3. API 预览:端点、输入、输出与访问方式
3.1 请求与响应结构
Hailuo 2.3 遵循简单的提交 → 轮询 → 下载流程。你发送一个 POST /video_generation 请求,得到一个 task_id,然后等待视频处理完成。之后,你轮询任务状态。任务完成后,API 会返回一个下载链接。这些字段对应着两条首发路径:文本生成视频和图片生成视频。
对于文本生成视频,请求需要一个 prompt 字段,提示词长度最多可达 2000 个字符。对于图片生成视频,你还需要发送 first_frame_image 作为参考图片,图片可以以公开 URL 或 Base64 字符串的形式传入。文件必须小于 20 MB,短边需大于 300 像素,宽高比必须在 2:5 到 5:2 之间。
主要的控制参数包括:
duration用于控制短片时长,常见取值为 6 秒或 10 秒resolution设置为"768P"或"1080P"prompt_optimizer作为一个可选标志
| 参数 | 类型 | 是否必填 | 说明 |
|---|---|---|---|
model | string | 是 | MiniMax-Hailuo-2.3 或 MiniMax-Hailuo-2.3-Fast |
prompt | string | 是 | 最多 2000 个字符;支持 [bracketed] 括号镜头标签 |
first_frame_image | string | 仅图生视频 | 公开 URL 或 Base64;小于 20 MB |
duration | integer | 否 | 常见取值:6 秒或 10 秒 |
resolution | string | 否 | "768P" 或 "1080P" |
prompt_optimizer | boolean | 否 | 可选的提示词优化标志 |
callback_url | string | 否 | 用于异步完成通知的 Webhook |
提交后,GET /query/video_generation 会返回类似 "processing"、"success" 或 "failed" 的状态。如果任务成功,响应中会包含视频 URL 或文件引用;如果失败,你会收到 error_code 和 error_message。
每 15 到 30 秒轮询一次是比较合理的节奏,频率过高只会产生无谓的噪音。还有一点:APIMart 上的输出链接有效期为 72 小时,所以生成完成后尽快将文件转存到自己的存储中会更稳妥。
3.2 直连访问与 APIMart 统一 API 访问

团队可以直接调用 MiniMax 的原生端点,在请求头中携带 Bearer token:
Authorization: Bearer YOUR_API_KEY
这种方式能让你与 MiniMax 官方文档和发布节奏保持最紧密的同步。
APIMart 为希望在一处统一管理多模态工作的团队提供了另一条路径。其统一 API 让你在文本、图片和视频调用之间只需一个 API 密钥和一份美元余额。它还采用了兼容 OpenAI 的请求格式,如果你的技术栈已经使用这种格式,配置起来会更简单。如果你要把多种模型类型接入同一条流水线,这样的设置能在客户端节省不少时间。
3.3 美元计价与计费
计费方式为按生成的每秒以美元计价。相比 MiniMax 官方定价,APIMart 的价格大约有 20% 的折扣。
| 模型版本 | 分辨率 | APIMart 价格(美元/秒) | 官方价格(美元/秒) |
|---|---|---|---|
| MiniMax-Hailuo-2.3 | 768P | ~$0.0488 | ~$0.061 |
| MiniMax-Hailuo-2.3 | 1080P | ~$0.072 | ~$0.090 |
| MiniMax-Hailuo-2.3-Fast | 768P | ~$0.0248 | ~$0.031 |
| MiniMax-Hailuo-2.3-Fast | 1080P | ~$0.0424 | ~$0.053 |
一种实用的成本管理方式是:先用 768P 进行测试,把 1080P 留给最终渲染。这样可以让早期迭代更便宜,同时为后续更高质量的交付留出空间。
4. 多模态工作流的集成模式
4.1 Python SDK 与 REST 实现模式
确定好请求和响应格式后,下一步就是把 Hailuo 2.3 接入一条可以反复运行的流水线中。最简单的理解方式是:Hailuo 2.3 是更大系统中的渲染层。把 API 密钥保存在环境变量中,每个请求都使用 Bearer 认证,用 requests 处理视频生成调用,同时依赖 SDK 来完成提示词编排。
import os
import time
import requests
API_KEY = os.environ["APIMART_API_KEY"]
BASE_URL = "https://api.apimart.ai/v1"
headers = {
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json",
}
payload = {
"model": "MiniMax-Hailuo-2.3",
"prompt": "[Slow zoom in] A ceramic coffee mug on a sunlit kitchen counter, steam rising, photorealistic",
"duration": 6,
"resolution": "768P",
"prompt_optimizer": True,
}
response = requests.post(f"{BASE_URL}/video_generation", json=payload, headers=headers)
task_id = response.json()["task_id"]
while True:
status_resp = requests.get(
f"{BASE_URL}/query/video_generation",
params={"task_id": task_id},
headers=headers,
)
result = status_resp.json()
if result["status"] == "success":
file_id = result.get("file_id")
video_url = result.get("video_url")
break
if result["status"] == "failed":
raise Exception(result.get("error_message", "Video generation failed"))
time.sleep(20)
如果轮询显得笨拙,可以添加一个 callback_url,让系统在渲染完成时主动通知你。之后,把返回的 file_id 或下载 URL 传入你的存储或发布环节。
API 流程搭建完成后,接下来的工作就是设置一套默认参数,把支出和输出质量控制在合理范围内。
4.2 面向内容与产品团队的流水线设计
大多数内容和产品团队只需三种流水线模式就足够了,它们对应本文的主要使用场景:文本生成视频、图片生成视频,以及渲染后的音频合成。[13][10][12][20][21]
对于广告短片工作流(文本 → 视频),由 LLM 构建一个结构化的提示词,包含场景设定、主体、动作描述和括号形式的镜头指令。例如:
[Pan left] A pair of running shoes on a track, golden hour lighting, cinematic
随后,这段提示词会被发送到 Hailuo 2.3 的文本生成视频请求中。这种设置非常适合 6 秒的短片。[16]
对于产品演示工作流(图片 → 视频),上传一张干净的产品静态图,并作为 first_frame_image 传给 Hailuo 2.3。这样既能保持产品视觉上的准确性,又能添加静态图片无法呈现的动态效果。[13][10][12]
对于旁白同步工作流(视频 + 音频),先渲染视频,然后在后期使用语音或音乐模型添加配音或音乐,最后在发布流水线中把所有内容合成到一起。
如果你需要超过 10 秒的连续镜头,可以把多个短片串联起来:取出前一次生成的最后一帧,将其作为 first_frame_image 传入下一次请求。这是一种简单的衔接方式,但有助于在各个片段之间保持角色外观和场景的连续性。[10][12]
4.3 上线前需要统一的参数
把这件事当作一项上线策略来对待会很有帮助。在扩大规模之前锁定一份简短的默认参数清单,能让输出保持稳定、成本更容易规划,也能让团队的使用方式保持一致。[16][17][18][19]
一份简短的清单通常就足够了:
- 提示词模板 - 使用统一的结构:场景设定、主体、动作、镜头方向,以及风格标签,例如
"cinematic"、"product demo"或"user-generated feel"。维护一个已验证有效的提示词库,让团队可以复用,而不必每次从零开始。[11][14][15] - 时长 - 根据任务需求匹配短片长度。预览和社交内容使用 6 秒短片,需要更长时间的营销活动则保留给 10 秒短片。
- 分辨率 - 将
768P设为草稿和迭代阶段的默认值,仅在最终渲染时使用1080P。 - 首帧图片规则 - 明确规定已批准的源图片存放位置,确保文件小于 20 MB 且短边大于 300 像素,并定义什么样的参考帧对图生视频工作来说是合格的。[10][17][18][15]
- 模型选择 - 大批量运行使用
MiniMax-Hailuo-2.3-Fast,更高保真度的最终输出则保留给MiniMax-Hailuo-2.3(Standard)。[19]
这些默认设置决定了接下来要讨论的成本结构和模型选择。
5. 成本、模型选择与最终要点
5.1 常见美国制作场景的成本估算
一旦发布配置和 API 流程都搭建完成,接下来要确定的就是制作成本。
在 Hailuo 2.3 上,一个 6 秒的 768p 短片成本约为 0.29 美元,10 秒短片约为 0.49 美元。在 Hailuo 2.3 Fast 上,同样的短片成本分别约为 0.15 美元和 0.25 美元。
对于一个每月以 768p 制作 80 个标准 10 秒产品短片的美国电商品牌来说,总生成成本约为 39.00 美元。
一种简单的思路是:
- 草稿、A/B 变体和批量测试使用 Hailuo 2.3 Fast
- 上线产品页面、付费社交广告和应用商店预览使用 Hailuo 2.3
价格当然重要,但不应该是唯一的决策依据。你需要输出达成什么目的,才是更重要的考量。
5.2 在 APIMart 的模型目录中选择 MiniMax Hailuo 2.3
这个选择最终归结为三点:最终输出质量、草稿速度,或批量产出。
| 模型 | 核心优势 | 支持的输出规格 | APIMart 价格(美元/秒) | 最适合的美国使用场景 |
|---|---|---|---|---|
| MiniMax Hailuo 2.3 | 动作质量、角色保真度、风格控制 | 768p:最长 10 秒;1080p:最长 6 秒 | $0.0488(768p)/ $0.072(1080p) | 品牌短片、产品演示、付费社交广告 |
| MiniMax Hailuo 2.3 Fast | 速度快、批量成本效益高 | 768p:最长 10 秒;1080p:最长 6 秒 | $0.0248(768p)/ $0.0424(1080p) | 草稿、创意变体、批量生成 |
好处在于,一次集成就能覆盖两个档位。所以如果你的团队想从草稿模式切换到最终输出模式,无需改动请求逻辑即可完成。
5.3 需要牢记的要点
如果你要在两个档位之间做选择,规则其实很简单:Hailuo 2.3 是为短视频而生的,尤其适合那些动作一致性和品牌契合度最重要的简短短片。
在扩大规模之前,先做一次严格的小范围试点:生成一批受控的 6 秒和 10 秒短片,然后与创意团队一起评审动作质量和品牌契合度,确认生成耗时符合你的制作流程节奏,并核实 APIMart 的账单视图中记录的使用秒数与总成本(美元)是否一致。
常见问题
我应该从哪个模型开始?
对大多数用户来说,Hailuo 03 是最好的起点。它是最新的模型,最适合处理复杂的多模态工作流,例如文本生成视频、图片生成视频、同步音频以及精确的镜头控制。
如果你需要风格化的艺术效果、人物动作或微表情,Hailuo 2.3 是不错的选择。如果你的工作更偏向物理性强的动作和高度逼真的运动效果,Hailuo 02 同样是一个稳妥的选择。
你可以通过统一的 APIMart API,设置 model 参数来访问以上所有模型。
如何生成超过 10 秒的短片?
对于超过 5 秒的视频,使用更低的分辨率,例如 768p 或 512p。1080p 仅支持最长 5 秒的短片,因此不适用于更长的输出。
需要超出 API 10 秒短片上限的内容?生成多个短片,然后在你的后端将它们拼接起来。最好以异步方式处理,可以通过轮询任务状态,或使用回调 URL 获取完成通知。
生成请求失败的常见原因是什么?
生成请求可能因以下几个常见原因而失败:
- 参数无效
- API 密钥无效
- 账户余额不足
- 速率限制(429)
- 服务器内部错误(5xx)
基于图片的请求也可能因为输入文件超过 20 MB,或宽高比超出 2:5 到 5:2 的范围而失败。
如果任务状态变为 failed,请查看 error_message 字段以获取具体原因。
去模型市场挑选你想要的模型
在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。