
Cursor Router:如何把 AI 模型成本砍掉 60%
了解 Cursor Router 如何通过把每个请求路由到能胜任的最低成本模型,配合质量校验、重试与分层控制,将 AI 模型成本降低约 60%。
是的——当大多数请求并不需要顶级模型时,模型路由可以把 AI 开支削减约 60%。 我会这样概括:检查每个提示词,把简单任务发给低成本模型,把困难或敏感任务留给更强的模型,并在扩大使用前持续跟踪采纳率、重试率、延迟和成本。
如果让我用一分钟讲清这篇文章,我会说:
- 核心思路: 不要把每个提示词都发给同一个昂贵的模型。
- 工作原理: 路由器检查任务类型、提示词长度、风险、模态和预算,然后选择一个模型层级。
- 省钱来源: 加权平均。如果 70% 的流量走低成本模型、25% 走中端模型、5% 走高端模型,单次请求的平均成本可以从约 $0.020 降到 $0.008。
- 质量为何能保持稳定: 质量不达标的输出可以重试一次,必要时再升级一个层级。
- 该衡量什么: 采纳率、重试率、p95/p99 延迟,以及按功能拆分的成本。
- 该避免什么: 过早把高风险的法律、金融或合规工作下放给廉价模型。
- 额外的成本控制: 提示词缓存最多可将部分输入成本降低 90%,但路由仍是主要驱动力。
几个数字值得关注。在示例中,每月 1,000,000 次请求的成本从全高端配置的约 $20,000 降到路由方案的约 $8,000。至于视频,把低风险任务的产量从约 $7.20/分钟转移到约 $1.50/分钟,同样的月度预算下产出几乎可以翻倍。
LLM 模型路由:在不损失质量的前提下削减 85% 的 AI 成本
快速对比
| 方案 | 请求如何处理 | 单次请求平均成本 | 100 万次请求的月成本 | 主要权衡 |
|---|---|---|---|---|
| 单一高端模型 | 所有请求都发给一个顶级模型 | $0.020 | $20,000 | 配置简单,开销高 |
| 路由模型组合 | 工作分配到经济、中端和高端模型 | $0.008 | $8,000 | 开销更低,但需要路由规则 |
我从文章中得到的结论很简单:Cursor Router 是一个成本控制层。它不会让某个模型变便宜,而是通过把每个请求发送到仍能把活干好的最低成本模型来降低开支。
Cursor Router 的工作原理

Cursor Router 让每个请求经过五个步骤:接收、检查、路由、执行和反馈记录。检查步骤很快,通常只需几十毫秒,因此几乎不增加延迟。正是这个快速检查,让路由器能把高端模型留给最难的任务。
请求检查与复杂度分类
在检查阶段,路由器会检视每个提示词的 token 数量、代码块、输出要求、模态,以及与金融、法律或合规内容相关的敏感标记。基于这些信号,它把请求标记为低、中或高复杂度。
简短、宽松的提示词通常落入低复杂度桶,交给低成本模型处理。包含代码文件、长上下文窗口或严格格式要求的提示词更可能被判为中或高复杂度,发送到更高层级。敏感标记可以把请求直接提升为高复杂度,哪怕提示词本身很短。
这些标签还可以附带硬性成本上限。低复杂度请求可以限制在 $0.002,中等在 $0.02,高等在 $0.20,这让开支更容易预测和审计。[2]
分层模型池、升级与降级兜底
三层模型池与这些复杂度标签一一对应:
| 层级 | 典型任务 | 预估成本(每 100 万 token) |
|---|---|---|
| 经济层(Tier 1) | 分类、打标签、短篇草稿 | $0.05–$0.10 |
| 中端层(Tier 2) | 摘要、问答、代码解释 | $0.25–$0.30 |
| 前沿层(Tier 3) | 复杂推理、法律/代码分析 | $1.25–$3.00 |
企业级指南建议只有 10% 到 20% 的查询应该进入 Tier 3,其余 80% 到 90% 应该由 Tier 1 或 Tier 2 处理。[1] 省钱的来源就在这里。大多数请求留在更便宜的层级,而层级之间的价差足够大,即使路由不够完美,也能实实在在地削减成本。这种分流是路由在不改变应用产出要求的前提下降低开支的主要原因。
路由器从看起来最可能胜任的最低层级开始,然后根据 schema 规则、必要段落和长度限制检查输出。如果结果不合格,就升级。系统允许在同一层级内重试一次,以及跨层级升级一次。在向上升级之前,它还可以先切换到同层级的另一个模型,让兜底行为始终与成本挂钩。
让路由随时间不断改进的遥测数据
每个请求都会生成一条遥测记录。记录包含层级、模型、token 数量、延迟、以美元计的账单成本、重试次数、升级路径,以及响应是被采纳、被编辑还是被拒绝。
这些数据会持续反哺路由规则。举例来说,如果低复杂度的邮件草稿在经济层显示出 99% 的采纳率,路由器就可以放宽阈值,把更多边界任务发过去。反过来,如果中等复杂度的分析任务不断升级,系统可以把它们直接路由到中端层,避免多余的重试。
关键工作负载(如财务摘要和合规内容)会始终固定在前沿模型上,直到遥测数据显示在一个持续窗口(如 30 天)内,较低层级也能达到同等采纳率。[2] 这让路由变得易于衡量和调优。日志把路由规则变成了直接的成本控制手段,也为下一节的省钱计算提供了数据基础。
60% 的节省从何而来

省钱的说法归根结底是加权平均。Cursor Router 优先把低复杂度请求发送到低成本层级,因此即使前沿模型仍然待命,混合开支也会下降。沿用上文路由逻辑中的经济、中端和前沿三个层级,一旦大部分流量不再进入前沿层,平均成本就会快速下降。
用直白的数字对比基线开支与路由开支
假设一个团队每月运行 1,000,000 次请求。在全前沿配置下,每个请求都走最高成本的模型。在路由配置下,约 70% 的请求是低复杂度、走经济模型,25% 走中端模型,只有 5% 到达前沿层。这与分类、短文改写和简单问答等常见模式的分布相符。
| 场景 | 模型组合 | 单次请求平均成本 | 月成本(100 万次请求) |
|---|---|---|---|
| 全前沿基线 | 100% 前沿 | ~$0.020 | ~$20,000 |
| 路由流量组合 | 70% 经济 / 25% 中端 / 5% 前沿 | ~$0.008 | ~$8,000 |
| 节省 | - | 约减少 60% | 每月约节省 $12,000 |
驱动这一切的是层级之间的价差。OpenAI 的 GPT-4o 定价为每 100 万输入 token $2.50、每 100 万输出 token $10.00,而 GPT-4o mini 为每 100 万 token 输入 $0.15、输出 $0.60。这意味着它在输入和输出上都便宜约 16.7 倍。[3][4] 一旦大部分流量转移到低成本层级,混合平均成本就会迅速下降。
研究也印证了这种降幅的量级。RouteLLM 是一个在模型之间路由查询的框架,据报告在 MT Bench 上相比始终使用 GPT-4 实现了超过 85% 的成本削减,同时性能接近 GPT-4。[6]
三大成本杠杆:模型选择、token 用量与避免过度用模
模型选择是最大的杠杆。 如果低成本模型能胜任,单 token 价格会大幅下降,这个价差在每月数百万次调用中会不断累积。
token 用量是第二个杠杆。 简单任务通常需要更少的输出 token。一个分类答案或一段短改写不需要冗长的推理,因此即使在同一层级内,账单也会更低。
第三个杠杆是避免使用超出任务需要的更强模型。 这正是路由的全部意义:让模型能力匹配任务难度,把高端开支留给真正需要它的那一小部分请求。
缓存还能进一步削减成本。在支持的平台上,提示词缓存最多可将输入 token 成本降低 90%。[7][8] 但路由仍是主要的省钱引擎,因为它改变的是_哪个_模型被计费。
接下来,同样的路由逻辑将应用到 APIMart 的文本、图像和视频工作负载上,价格和使用场景共同决定模型选择。
将 Cursor Router 应用于 APIMart 的文本、图像与视频工作负载

APIMart 让路由器在一个 API Key 和一个计费账户背后自由切换模型。因此你不需要为每个模型单独搭建。同样的路由逻辑现在可以覆盖 APIMart 的文本、图像和视频工作负载:一个目录、一张账单、更低的混合开支。
在 APIMart 多模型目录中进行路由
路由器从三个维度检查每个请求:模态(文本、图像或视频)、质量目标(草稿、成品或高端)和预算约束(以美元计的单次请求和月度上限)。路由规则以代码形式存在。由于 APIMart 使用统一的 schema,切换模型 ID 不需要额外鉴权或重新构造请求。
对于文本,三层策略对许多团队来说都是切实可行的。举例来说,一个美国媒体团队可以把内部草稿发到 Tier 1,使用 Gemini Flash 这类低成本模型,价格为每 100 万 token 输入 $0.075 / 输出 $0.30。面向客户的文案可以走 Tier 2 的中等价位指令微调模型。旗舰营销内容则可以进入 Tier 3,使用 GPT-4o,价格为每 100 万 token 输入 $2.50 / 输出 $10.00。
如果 70% 的 token 落在 Tier 1、25% 在 Tier 2、只有 5% 在 Tier 3,与全部发往顶级层相比,混合成本可下降 40%–60%。这就是核心思想:把昂贵的模型留给真正需要它的工作。
同样的配置也适用于图像。内部原型图可以走经济型图像模型,而最终广告创意走更高层级的图像模型,使用与文本路由相同的元数据标签。
按价格与使用场景进行视频生成路由
视频是省钱效果最猛的地方,因为价格差距会随着生成时长的增加而放大。在 APIMart 的目录中,最便宜和最贵的模型之间,每秒定价相差近 5 倍。这使得模型与使用场景的匹配在这里比任何其他模态都更重要。
| 模型 | 每秒约价(美元) | 最适合 | 路由层级 | 每分钟平均成本 |
|---|---|---|---|---|
| MiniMax Hailuo 2.3 | $0.025 | 草稿、社交短片、背景循环视频 | Tier 1(经济) | ~$1.50 |
| Kling V3 Omni(720p) | $0.0672 | 常规营销、应用内动画 | Tier 2(均衡) | ~$4.03 |
| Sora 2 Preview | $0.08 | 高影响力营销活动、电影级内容 | Tier 3(高端) | ~$4.80 |
| Vidu Q3 Pro | $0.12 | 广播级广告、旗舰发布 | Tier 3(高端) | ~$7.20 |
以一家美国 SaaS 公司为例。它可以给所有应用内教程视频打上 "use_case": "tutorial" 标签,全部路由到 MiniMax Hailuo 2.3,同时把 Veo 3.1 或 Vidu Q3 Pro 留给每月少量的旗舰发布视频。这样就把大部分产量从每分钟 $7.20 转移到了大约每分钟 $1.50。
美国团队的月度预算场景
路由规则就位后,下一步很简单:在固定的月度预算下,团队能产出多少内容?
假设一家美国广告公司在 APIMart 上有 $10,000/月的视频预算:
- 不做路由(全部用 Vidu Q3 Pro): 按 $7.20/分钟计算,$10,000 大约能买 1,389 分钟(约 83,340 秒)视频。
- 路由强制组合(60% MiniMax / 25% Kling / 15% Sora + Vidu): 混合平均降到约 $3.00–$3.50/分钟,可产出约 2,850–3,333 分钟——同样的开支下大约 2 倍的产量。
这不过是加权平均的数学在月度预算中的体现。60% 的省钱说法来自把大部分产量转移到低成本层级,而不是让任何单个模型变便宜。而且由于 APIMart 把所有模型费用汇总到一张以美元计价的账单中,财务和工程团队可以直接把路由日志与 APIMart 的账单条目对照,核对预测开支与实际开支。
落地实施、效果衡量与关键结论
基于路由的推理的简单生产架构
路由规则确定后,下一步很简单:上线并持续衡量。
添加路由不需要重构你的技术栈。把每个 AI 请求连同任务类型、延迟目标、用户层级和提示词发送到 POST /v1/route。Cursor Router 会选择模型,并通过 APIMart 的统一 API 返回响应。
前后对比让这笔权衡一目了然:
| 对比维度 | 使用路由前(单一前沿模型) | 使用路由后(经 APIMart 的分层模型) |
|---|---|---|
| 平均延迟(ms) | 900 | 750 |
| 单次请求平均成本(美元) | $0.020 | $0.008 |
| 工程复杂度 | 多个集成、自定义重试 | 单一统一 API、集中化策略 |
通过 OpenTelemetry、Prometheus 和你的仪表盘体系记录模型、token、延迟、美元成本和结果。[10][11] 在大多数部署中,基于规则的路由增加的开销不到 5 ms,因此路由器本身不应该成为瓶颈。[9]
如何在不损害质量的前提下验证节省效果
路由上线后,在把更多流量导入之前,先对照当前基线核对节省情况。
做一次受控分流。让一部分生产流量继续走全前沿基线,其余流量经过 Cursor Router。用同样的方式对两组进行埋点,然后比较四项指标:
- 采纳率
- 重试率
- 按功能拆分的美元成本
- SLA 达标情况,包括 p95 和 p99 延迟与目标的对比
从低风险流量上的确定性规则开始。短提示词可以走中端模型,内部工具可以走经济模型,计费和合规流程则应留在前沿模型上。当遥测数据显示采纳率和重试率保持稳定后,收紧阈值,把路由推广到更多功能。
如果任何一部分流量在质量上落后于基线,就把它固定回高端模型。这就是那个循环:衡量、调整、扩展。
结论:关于 Cursor Router 与 60% 省钱说法,你该记住什么
如果这些数字在生产环境中站得住脚,就逐步把路由扩展到更多工作负载。
基准测试显示,分层路由可以把成本降到基线的约 42%,同时还能降低延迟。[5] APIMart 的统一 API 让这一切切实可行:一个集成点、统一的用量报告、以美元计的定价。这意味着 Cursor Router 可以切换模型,而你这边无需额外的工程工作。把 60% 这个数字当作待验证的目标,而非保证。用与自己基线并排对比的成本和质量测量来验证它,等数据说可以了再进一步推广。
常见问题
Cursor Router 如何决定使用哪个模型?
Cursor Router 会审视每个请求,权衡任务有多难和它应该花多少钱,然后把它发送到最合适的模型。
它通过一个路由或分类步骤来实现。说白了,它会先把摘要、分类、高级推理这类工作分好类,再决定这个请求该去哪里。
于是更难的查询被发送到高端模型,而常规流量走低成本选项。这样一来,昂贵的模型就能专注于最需要它们火力的那 5–15% 的任务。
什么时候应该把请求升级到更高层级的模型?
当低成本模型达不到要求的置信度阈值,或者任务需要更深入的推理(如高级编程、创意写作或高风险分析)时,就应该升级请求。
升级也可以作为兜底手段——当主模型遇到性能问题、延迟飙升或服务中断时使用。
如果日志显示低成本模型的升级频率超过 30%,就该重新审视你的路由逻辑了。
团队如何在不损害质量的前提下测试路由?
以你当前的高端模型作为成本和性能的双重基线。这样在做任何改动之前,你就有了一个干净的对照点。
在此基础上,测试分层路由方案。把一小部分受控流量发送到低成本模型,同时仍把高端模型留给关键任务。这是一种在不拿最重要任务冒险的前提下削减开支的简单方式。
在预发环境中搭建降级链路,然后刻意去测试它。人为制造错误或吊销 API Key,确认请求会按你的预期切换模型。之后,密切关注成功率和延迟。这些数字会告诉你路由规则哪里靠得住、哪里还需要打磨。
去模型市场挑选你想要的模型
在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。