APIMart
MiniMax 新一代模型:发布与 API 预览

MiniMax 新一代模型:发布与 API 预览

MiniMax Hailuo 2.3 可通过文字或图片生成 6-10 秒的电影级短片。了解其功能、提交-轮询-下载的 API 流程,以及 APIMart 上按秒计费的美元定价。

教程

如果你想现在就试用 MiniMax Hailuo 2.3,简短的答案是: Standard 模型支持文本生成视频图片生成视频,Fast 模型仅支持图片生成视频,输出为 768p1080p 分辨率的 6 秒或 10 秒短片。Standard 定价约为每个 6 秒短片 0.28 美元起,Fast 约为 0.19 美元,配合简单的提交 → 轮询 → 下载的 API 流程。

如果只看最重要的部分,这次发布主要涉及四件事:

  • 现在能做什么: 文本生成视频和图片生成视频
  • 成本如何:APIMart 上,根据模型和分辨率不同,每秒约 0.0248 到 0.072 美元
  • 如何接入: 先调用 POST /video_generation,再通过 GET /query/video_generation 查询状态
  • 最适合谁: 制作短广告、产品短片、讲解视频以及测试变体的团队

同时也存在一些明确的限制。Fast 不支持文本生成视频。 输入图片必须小于 20 MB,短边需大于 300 像素,且宽高比需在允许范围内。Standard 模型通常每个短片需要约 30 到 90 秒的生成时间,因此它更适合短视频任务,而非长篇剪辑。

MiniMax Hailuo 2.3 与 Fast 对比:价格、功能与使用场景
MiniMax Hailuo 2.3 与 Fast 对比:价格、功能与使用场景

Minimax Hailuo API 教程:克隆声音、AI 视频与音乐生成 + Make.com 自动化

快速对比

模型输入类型输出时长分辨率起始价格最适合
MiniMax-Hailuo-2.3文本或图片6 秒或 10 秒768p、1080p每 6 秒短片 $0.28成片、广告、产品视频
MiniMax-Hailuo-2.3-Fast仅图片6 秒或 10 秒768p、1080p每 6 秒短片 $0.19草稿、测试、批量输出

让我印象最深的是:这个模型很容易上手尝试,定价也容易估算,API 也很直观。所以,如果你在评估 Hailuo 2.3 是否适合你的工作流,真正的问题不是“我能不能用上它”,而是**“我想要更好的输出质量,还是更低的单片成本?”**

2. MiniMax Hailuo 2.3 首发都带来了什么

MiniMax Hailuo 2.3 是 MiniMax 面向短视频的电影级短片生成模型,专为流畅的动作、富有表现力的角色,以及紧扣提示词要求的输出而打造。

2.1 核心能力与支持的工作流

在模型层面,主要的选择在于 StandardFast 之间。

Standard Hailuo 2.3 同时支持文本生成视频和图片生成视频,能带来更好的动作一致性、更逼真的输出,以及更精细的风格控制。它通常每个短片需要约 30 到 90 秒的生成时间。[2][5][7]

Fast 仅支持图片生成视频。它更偏向速度和更低成本,但代价是牺牲一部分图像质量。[3]

播放帧率大约在电影级的 24 fps 左右,但这应被视为一个大致目标,而非固定规格。[3][7][8]

实际上,这个选择会立即影响三件事:

  • 每个短片需要多长时间
  • 输出效果有多精致
  • 团队从提示词到成稿草案的速度有多快

2.2 动作、角色与风格方面的提升

相较于 Hailuo 02,最大的进步体现在角色动作与情绪表现上。

Hailuo 2.3 使用面部肌肉模拟技术来处理眉毛动作、眼神焦点变化、轻微头部倾斜等细微表情。它还使用 Global Identity VAE 让面部、发型和服装在帧与帧之间保持更高的稳定性。[1][4][9]

镜头运动的表现也更强。你可以使用像 [Pan left][Zoom in][Tracking shot] 这样的括号指令,模型在单个提示词中最多支持三个此类指令。除此之外,Hailuo 2.3 还新增了更多风格控制选项,支持动漫、水墨画和游戏 CG 美术风格的渲染效果。[1][4][6][9]

这意味着团队可以更精确地把控短片的观感。无论是角色特写、缓慢推近镜头,还是风格化的产品镜头,都不再是靠猜测,而更像是一项提示词写作的工作。

2.3 Hailuo 2.3 最适合的场景

Hailuo 2.3 最适合制作简短有力的短片。如果你需要更长的作品,更合理的做法是在这里生成各个镜头,再用常规剪辑软件将它们拼接起来。

工作流类型优势限制最适合的使用场景
文本生成视频提示词遵循度高,输出风格化仅限 Standard 模型社交短片、风格化预告片
图片生成视频角色一致性好,源图细节稳定需要高质量的源图片产品旋转展示、电商广告
Fast(仅图生视频)生成更快,成本更低不支持文本生成视频;保真度较低批量草稿、A/B 测试

当输出质量、风格方向和提示词细节最重要时,使用 Standard Hailuo 2.3,例如主打广告、预告片,或以角色为核心的场景。当速度和产量更重要时,切换到 Fast,尤其适用于变体测试或批量社交内容生产。

这些发布层面的差异,直接延续到了下一节中关于 API 配置、输出限制和集成决策的讨论。

3. API 预览:端点、输入、输出与访问方式

3.1 请求与响应结构

Hailuo 2.3 遵循简单的提交 → 轮询 → 下载流程。你发送一个 POST /video_generation 请求,得到一个 task_id,然后等待视频处理完成。之后,你轮询任务状态。任务完成后,API 会返回一个下载链接。这些字段对应着两条首发路径:文本生成视频图片生成视频

对于文本生成视频,请求需要一个 prompt 字段,提示词长度最多可达 2000 个字符。对于图片生成视频,你还需要发送 first_frame_image 作为参考图片,图片可以以公开 URL 或 Base64 字符串的形式传入。文件必须小于 20 MB,短边需大于 300 像素,宽高比必须在 2:5 到 5:2 之间。

主要的控制参数包括:

  • duration 用于控制短片时长,常见取值为 6 秒或 10
  • resolution 设置为 "768P""1080P"
  • prompt_optimizer 作为一个可选标志
参数类型是否必填说明
modelstringMiniMax-Hailuo-2.3MiniMax-Hailuo-2.3-Fast
promptstring最多 2000 个字符;支持 [bracketed] 括号镜头标签
first_frame_imagestring仅图生视频公开 URL 或 Base64;小于 20 MB
durationinteger常见取值:6 秒或 10 秒
resolutionstring"768P""1080P"
prompt_optimizerboolean可选的提示词优化标志
callback_urlstring用于异步完成通知的 Webhook

提交后,GET /query/video_generation 会返回类似 "processing""success""failed" 的状态。如果任务成功,响应中会包含视频 URL 或文件引用;如果失败,你会收到 error_codeerror_message

15 到 30 秒轮询一次是比较合理的节奏,频率过高只会产生无谓的噪音。还有一点:APIMart 上的输出链接有效期为 72 小时,所以生成完成后尽快将文件转存到自己的存储中会更稳妥。

3.2 直连访问与 APIMart 统一 API 访问

GccAi

团队可以直接调用 MiniMax 的原生端点,在请求头中携带 Bearer token:

Authorization: Bearer YOUR_API_KEY

这种方式能让你与 MiniMax 官方文档和发布节奏保持最紧密的同步。

APIMart 为希望在一处统一管理多模态工作的团队提供了另一条路径。其统一 API 让你在文本、图片和视频调用之间只需一个 API 密钥一份美元余额。它还采用了兼容 OpenAI 的请求格式,如果你的技术栈已经使用这种格式,配置起来会更简单。如果你要把多种模型类型接入同一条流水线,这样的设置能在客户端节省不少时间。

3.3 美元计价与计费

计费方式为按生成的每秒美元计价。相比 MiniMax 官方定价,APIMart 的价格大约有 20% 的折扣

模型版本分辨率APIMart 价格(美元/秒)官方价格(美元/秒)
MiniMax-Hailuo-2.3768P~$0.0488~$0.061
MiniMax-Hailuo-2.31080P~$0.072~$0.090
MiniMax-Hailuo-2.3-Fast768P~$0.0248~$0.031
MiniMax-Hailuo-2.3-Fast1080P~$0.0424~$0.053

一种实用的成本管理方式是:先用 768P 进行测试,把 1080P 留给最终渲染。这样可以让早期迭代更便宜,同时为后续更高质量的交付留出空间。

4. 多模态工作流的集成模式

4.1 Python SDK 与 REST 实现模式

确定好请求和响应格式后,下一步就是把 Hailuo 2.3 接入一条可以反复运行的流水线中。最简单的理解方式是:Hailuo 2.3 是更大系统中的渲染层。把 API 密钥保存在环境变量中,每个请求都使用 Bearer 认证,用 requests 处理视频生成调用,同时依赖 SDK 来完成提示词编排。

import os
import time
import requests

API_KEY = os.environ["APIMART_API_KEY"]
BASE_URL = "https://api.apimart.ai/v1"

headers = {
    "Authorization": f"Bearer {API_KEY}",
    "Content-Type": "application/json",
}

payload = {
    "model": "MiniMax-Hailuo-2.3",
    "prompt": "[Slow zoom in] A ceramic coffee mug on a sunlit kitchen counter, steam rising, photorealistic",
    "duration": 6,
    "resolution": "768P",
    "prompt_optimizer": True,
}

response = requests.post(f"{BASE_URL}/video_generation", json=payload, headers=headers)
task_id = response.json()["task_id"]

while True:
    status_resp = requests.get(
        f"{BASE_URL}/query/video_generation",
        params={"task_id": task_id},
        headers=headers,
    )
    result = status_resp.json()

    if result["status"] == "success":
        file_id = result.get("file_id")
        video_url = result.get("video_url")
        break
    if result["status"] == "failed":
        raise Exception(result.get("error_message", "Video generation failed"))

    time.sleep(20)

如果轮询显得笨拙,可以添加一个 callback_url,让系统在渲染完成时主动通知你。之后,把返回的 file_id 或下载 URL 传入你的存储或发布环节。

API 流程搭建完成后,接下来的工作就是设置一套默认参数,把支出和输出质量控制在合理范围内。

4.2 面向内容与产品团队的流水线设计

大多数内容和产品团队只需三种流水线模式就足够了,它们对应本文的主要使用场景:文本生成视频、图片生成视频,以及渲染后的音频合成。[13][10][12][20][21]

对于广告短片工作流(文本 → 视频),由 LLM 构建一个结构化的提示词,包含场景设定、主体、动作描述和括号形式的镜头指令。例如:

[Pan left] A pair of running shoes on a track, golden hour lighting, cinematic

随后,这段提示词会被发送到 Hailuo 2.3 的文本生成视频请求中。这种设置非常适合 6 秒的短片。[16]

对于产品演示工作流(图片 → 视频),上传一张干净的产品静态图,并作为 first_frame_image 传给 Hailuo 2.3。这样既能保持产品视觉上的准确性,又能添加静态图片无法呈现的动态效果。[13][10][12]

对于旁白同步工作流(视频 + 音频),先渲染视频,然后在后期使用语音或音乐模型添加配音或音乐,最后在发布流水线中把所有内容合成到一起。

如果你需要超过 10 秒的连续镜头,可以把多个短片串联起来:取出前一次生成的最后一帧,将其作为 first_frame_image 传入下一次请求。这是一种简单的衔接方式,但有助于在各个片段之间保持角色外观和场景的连续性。[10][12]

4.3 上线前需要统一的参数

把这件事当作一项上线策略来对待会很有帮助。在扩大规模之前锁定一份简短的默认参数清单,能让输出保持稳定、成本更容易规划,也能让团队的使用方式保持一致。[16][17][18][19]

一份简短的清单通常就足够了:

  • 提示词模板 - 使用统一的结构:场景设定、主体、动作、镜头方向,以及风格标签,例如 "cinematic""product demo""user-generated feel"。维护一个已验证有效的提示词库,让团队可以复用,而不必每次从零开始。[11][14][15]
  • 时长 - 根据任务需求匹配短片长度。预览和社交内容使用 6 秒短片,需要更长时间的营销活动则保留给 10 秒短片。
  • 分辨率 - 将 768P 设为草稿和迭代阶段的默认值,仅在最终渲染时使用 1080P
  • 首帧图片规则 - 明确规定已批准的源图片存放位置,确保文件小于 20 MB 且短边大于 300 像素,并定义什么样的参考帧对图生视频工作来说是合格的。[10][17][18][15]
  • 模型选择 - 大批量运行使用 MiniMax-Hailuo-2.3-Fast,更高保真度的最终输出则保留给 MiniMax-Hailuo-2.3(Standard)。[19]

这些默认设置决定了接下来要讨论的成本结构和模型选择。

5. 成本、模型选择与最终要点

5.1 常见美国制作场景的成本估算

一旦发布配置和 API 流程都搭建完成,接下来要确定的就是制作成本

Hailuo 2.3 上,一个 6 秒的 768p 短片成本约为 0.29 美元,10 秒短片约为 0.49 美元。在 Hailuo 2.3 Fast 上,同样的短片成本分别约为 0.15 美元0.25 美元

对于一个每月以 768p 制作 80 个标准 10 秒产品短片的美国电商品牌来说,总生成成本约为 39.00 美元

一种简单的思路是:

  • 草稿、A/B 变体和批量测试使用 Hailuo 2.3 Fast
  • 上线产品页面、付费社交广告和应用商店预览使用 Hailuo 2.3

价格当然重要,但不应该是唯一的决策依据。你需要输出达成什么目的,才是更重要的考量。

5.2 在 APIMart 的模型目录中选择 MiniMax Hailuo 2.3

这个选择最终归结为三点:最终输出质量、草稿速度,或批量产出

模型核心优势支持的输出规格APIMart 价格(美元/秒)最适合的美国使用场景
MiniMax Hailuo 2.3动作质量、角色保真度、风格控制768p:最长 10 秒;1080p:最长 6 秒$0.0488(768p)/ $0.072(1080p)品牌短片、产品演示、付费社交广告
MiniMax Hailuo 2.3 Fast速度快、批量成本效益高768p:最长 10 秒;1080p:最长 6 秒$0.0248(768p)/ $0.0424(1080p)草稿、创意变体、批量生成

好处在于,一次集成就能覆盖两个档位。所以如果你的团队想从草稿模式切换到最终输出模式,无需改动请求逻辑即可完成。

5.3 需要牢记的要点

如果你要在两个档位之间做选择,规则其实很简单:Hailuo 2.3 是为短视频而生的,尤其适合那些动作一致性和品牌契合度最重要的简短短片。

在扩大规模之前,先做一次严格的小范围试点:生成一批受控的 6 秒和 10 秒短片,然后与创意团队一起评审动作质量和品牌契合度,确认生成耗时符合你的制作流程节奏,并核实 APIMart 的账单视图中记录的使用秒数与总成本(美元)是否一致。

常见问题

我应该从哪个模型开始?

对大多数用户来说,Hailuo 03 是最好的起点。它是最新的模型,最适合处理复杂的多模态工作流,例如文本生成视频、图片生成视频、同步音频以及精确的镜头控制。

如果你需要风格化的艺术效果、人物动作或微表情,Hailuo 2.3 是不错的选择。如果你的工作更偏向物理性强的动作和高度逼真的运动效果,Hailuo 02 同样是一个稳妥的选择。

你可以通过统一的 APIMart API,设置 model 参数来访问以上所有模型。

如何生成超过 10 秒的短片?

对于超过 5 秒的视频,使用更低的分辨率,例如 768p512p1080p 仅支持最长 5 秒的短片,因此不适用于更长的输出。

需要超出 API 10 秒短片上限的内容?生成多个短片,然后在你的后端将它们拼接起来。最好以异步方式处理,可以通过轮询任务状态,或使用回调 URL 获取完成通知。

生成请求失败的常见原因是什么?

生成请求可能因以下几个常见原因而失败:

  • 参数无效
  • API 密钥无效
  • 账户余额不足
  • 速率限制(429
  • 服务器内部错误(5xx

基于图片的请求也可能因为输入文件超过 20 MB,或宽高比超出 2:5 到 5:2 的范围而失败。

如果任务状态变为 failed,请查看 error_message 字段以获取具体原因。

看完就试试

去模型市场挑选你想要的模型

在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。

聊天模型图像模型视频模型
进入模型市场