
Cursor Router: как сократить расходы на AI-модели на 60%
Как Cursor Router снижает расходы на AI-модели примерно на 60%, направляя каждый промпт к самой дешёвой подходящей модели — с проверками качества и ретраями.
Да — маршрутизация моделей может сократить расходы на ИИ примерно на 60%, когда большинству запросов не нужна топовая модель. Я бы сформулировал так: анализируйте каждый промпт, отправляйте простую работу дешёвым моделям, держите сложные и чувствительные задачи на сильных моделях и отслеживайте долю принятых ответов, ретраи, задержку и стоимость, прежде чем расширять использование.
Если бы мне нужно было пересказать статью за минуту, я бы сказал:
- Главная идея: не отправляйте каждый промпт в одну и ту же дорогую модель.
- Как это работает: роутер оценивает тип задачи, длину промпта, риск, модальность и бюджет, а затем выбирает уровень модели.
- Откуда берётся экономия: из средневзвешенных значений. Если 70% трафика идёт на дешёвые модели, 25% — на средний уровень и 5% — на премиальные, средняя стоимость может упасть примерно с $0.020 до $0.008 за запрос.
- Почему качество может не пострадать: слабый ответ можно один раз перегенерировать, а затем при необходимости поднять на уровень выше.
- Что измерять: долю принятых ответов, долю ретраев, задержку p95/p99 и стоимость на фичу.
- Чего избегать: не спешите переводить рискованные юридические, финансовые и комплаенс-задачи на дешёвые модели.
- Дополнительный контроль расходов: кэширование промптов может снизить часть затрат на вход до 90%, но основной драйвер экономии — всё же маршрутизация.
Несколько цифр обращают на себя внимание. В примере 1,000,000 запросов в месяц дешевеют примерно с $20,000 на полностью премиальной конфигурации до примерно $8,000 с маршрутизацией. А в видео перенос объёма с примерно $7.20/минута на примерно $1.50/минута для менее ответственных задач может почти удвоить выпуск при том же месячном бюджете.
Маршрутизация LLM-моделей: минус 85% расходов на ИИ без потери качества
Быстрое сравнение
| Конфигурация | Как обрабатываются запросы | Средняя стоимость запроса | Месячные расходы при 1M запросов | Главный компромисс |
|---|---|---|---|---|
| Одна премиальная модель | Всё идёт в одну топовую модель | $0.020 | $20,000 | Простая настройка, высокие расходы |
| Маршрутизируемый микс моделей | Работа распределяется между бюджетными, средними и премиальными моделями | $0.008 | $8,000 | Ниже расходы, нужны правила маршрутизации |
Мой вывод из статьи прост: Cursor Router — это слой контроля расходов. Он не делает какую-то одну модель дешевле. Он снижает траты, отправляя каждый запрос к самой дешёвой модели, которая всё ещё справляется с задачей достаточно хорошо.
Как работает Cursor Router

Cursor Router проводит каждый запрос через пять шагов: приём, инспекция, маршрутизация, выполнение и логирование обратной связи. Шаг инспекции быстрый — обычно десятки миллисекунд, так что задержка почти не растёт. Именно эта быстрая проверка позволяет роутеру беречь премиальные модели для самых сложных задач.
Инспекция запросов и классификация сложности
Во время инспекции роутер проверяет каждый промпт: число токенов, блоки кода, требования к выводу, модальность и флаги чувствительности, связанные с финансовым, юридическим или комплаенс-контентом. По этим сигналам он помечает запрос как низкой, средней или высокой сложности.
Короткие, свободные промпты обычно попадают в корзину низкой сложности и уходят к дешёвой модели. Промпты с файлами кода, длинными контекстными окнами или строгими правилами форматирования чаще получают среднюю или высокую сложность и отправляются на уровень выше. Флаги чувствительности могут сразу перевести запрос в высокую сложность, даже если сам промпт короткий.
Эти метки могут включать и жёсткие лимиты стоимости. Запросы низкой сложности можно ограничить $0.002, средней — $0.02, высокой — $0.20, что делает расходы проще для прогнозирования и аудита.[2]
Уровни моделей, эскалация и запасные варианты
Трёхуровневый пул моделей соответствует этим меткам сложности:
| Уровень | Типичные задачи | Ориентировочная стоимость (за 1M токенов) |
|---|---|---|
| Бюджетный (Tier 1) | Классификация, теггирование, короткие черновики | $0.05–$0.10 |
| Средний (Tier 2) | Суммаризация, вопросы-ответы, объяснение кода | $0.25–$0.30 |
| Флагманский (Tier 3) | Сложные рассуждения, юридический анализ и анализ кода | $1.25–$3.00 |
Корпоративные рекомендации говорят, что на Tier 3 должно попадать лишь 10%–20% запросов. Остальные 80%–90% должны обрабатываться Tier 1 или Tier 2.[1] Именно отсюда и берётся экономия. Большинство запросов остаётся на дешёвых уровнях, а разрыв в цене настолько велик, что даже неидеальная маршрутизация всё равно ощутимо снижает расходы. Это распределение — главная причина, по которой маршрутизация уменьшает траты, не меняя того, что должно выдавать приложение.
Роутер начинает с самого низкого уровня, который выглядит подходящим. Затем он проверяет вывод на соответствие схеме, обязательным разделам и лимитам длины. Если результат не проходит, происходит эскалация. Система допускает один ретрай на том же уровне и одну эскалацию между уровнями. Перед повышением она может также переключиться на другую модель того же уровня, что удерживает поведение при сбоях в рамках бюджета.
Телеметрия, которая со временем улучшает маршрутизацию
Каждый запрос создаёт запись телеметрии. В неё входят уровень, модель, число токенов, задержка, выставленная стоимость в долларах США, число ретраев, путь эскалации и то, был ли ответ использован, отредактирован или отклонён.
Со временем эти данные возвращаются в правила маршрутизации. Например, если черновики писем низкой сложности показывают 99% принятия на бюджетном уровне, роутер может ослабить порог и отправлять туда больше пограничной работы. И наоборот: если аналитические задачи средней сложности постоянно эскалируются, система может направлять их сразу на средний уровень, избегая лишних ретраев.
Критичные нагрузки, такие как финансовые сводки и комплаенс-контент, остаются закреплёнными за флагманскими моделями, пока телеметрия не покажет, что более низкий уровень выдерживает те же показатели принятия на длительном окне, например 30 дней.[2] Благодаря этому маршрутизацию легко измерять и настраивать. Логи превращают правила маршрутизации в прямой контроль расходов и питают расчёты экономии из следующего раздела.
Откуда берутся 60% экономии

Заявленная экономия сводится к средневзвешенным значениям. Cursor Router сначала отправляет менее сложные запросы на дешёвые уровни, поэтому смешанные расходы падают, даже когда флагманские модели остаются под рукой. Если взять те же уровни — бюджетный, средний и флагманский — из логики маршрутизации выше, средняя стоимость быстро падает, как только основной трафик перестаёт идти на флагманский уровень.
Базовые и маршрутизируемые расходы в простых цифрах
Возьмём команду с 1,000,000 запросов в месяц. В полностью флагманской конфигурации каждый запрос идёт в самую дорогую модель. При маршрутизации примерно 70% запросов имеют низкую сложность и уходят на бюджетную модель, 25% — на модель среднего уровня, и лишь 5% доходят до флагманского уровня. Это соответствует типичным сценариям: классификация, короткие переписывания и простые вопросы-ответы.
| Сценарий | Микс моделей | Средняя стоимость запроса | Месячные расходы (1M запросов) |
|---|---|---|---|
| Полностью флагманская база | 100% флагман | ~$0.020 | ~$20,000 |
| Маршрутизируемый микс трафика | 70% бюджет / 25% средний / 5% флагман | ~$0.008 | ~$8,000 |
| Экономия | - | ~60% снижения | ~$12,000 экономии/месяц |
Всё это движется разрывом в ценах между уровнями. GPT-4o от OpenAI стоит $2.50 за миллион входных токенов и $10.00 за миллион выходных, тогда как GPT-4o mini обходится в $0.15 за вход и $0.60 за выход на миллион токенов. То есть примерно в 16.7x дешевле и на входе, и на выходе.[3][4] Как только основной трафик уходит на дешёвый уровень, смешанное среднее падает стремительно.
Масштаб этого падения подтверждают исследования. RouteLLM, фреймворк маршрутизации запросов между моделями, показал более 85% снижения расходов на MT Bench по сравнению с постоянным использованием GPT-4, при производительности, близкой к GPT-4.[6]
Главные рычаги стоимости: выбор модели, расход токенов и отказ от избыточных моделей
Выбор модели — самый большой рычаг. Если с задачей справляется более дешёвая модель, цена за токен резко падает, и эта разница накапливается на миллионах вызовов каждый месяц.
Расход токенов — второй рычаг. Простым задачам часто нужно меньше выходных токенов. Ответ-классификация или короткое переписывание не требуют долгих рассуждений, поэтому счёт остаётся ниже даже внутри одного уровня.
Третий рычаг — не использовать модели мощнее, чем требует задача. В этом и есть смысл маршрутизации: сопоставлять силу модели со сложностью задачи и беречь премиальные расходы для той небольшой доли запросов, которым они действительно нужны.
Кэширование может урезать расходы ещё сильнее. Кэширование промптов на поддерживающих его платформах способно снизить стоимость входных токенов до 90%.[7][8] Но главный двигатель экономии — всё же маршрутизация, потому что она меняет то, какая модель попадает в счёт.
Дальше та же логика маршрутизации применяется к текстовым, графическим и видеозадачам APIMart, где выбор модели определяют цена и сценарий использования.
Применение Cursor Router к текстовым, графическим и видеозадачам APIMart

APIMart позволяет роутеру переключать модели за одним API-ключом и одним платёжным аккаунтом. Так что отдельная настройка для каждой модели не нужна. Одна и та же логика маршрутизации теперь работает для текста, изображений и видео в APIMart: один каталог, один счёт и более низкие смешанные расходы.
Маршрутизация по мультимодельному каталогу APIMart
Роутер оценивает каждый запрос по трём измерениям: модальность (текст, изображение или видео), целевое качество (черновик, финал или премиум) и бюджетные ограничения (лимиты на запрос и на месяц в долларах США). Правила маршрутизации живут в коде. А поскольку APIMart использует единую схему, смена ID модели не требует дополнительной аутентификации или переформатирования запросов.
Для текста многим командам практично подходит трёхуровневая политика. Например, медиакоманда из США может отправлять внутренние черновики на Tier 1 с дешёвыми моделями вроде Gemini Flash по $0.075 за вход / $0.30 за выход на миллион токенов. Клиентские тексты могут идти на Tier 2 с инструкционными моделями средней цены. А флагманский контент кампаний — на Tier 3 с GPT-4o по $2.50 за вход / $10.00 за выход на миллион токенов.
Если 70% токенов попадает на Tier 1, 25% — на Tier 2 и лишь 5% — на Tier 3, смешанная стоимость падает на 40%–60% по сравнению с отправкой всего на верхний уровень. В этом и суть: беречь дорогую модель для работы, которой она действительно нужна.
Та же схема применима к изображениям. Внутренние макеты могут идти на бюджетные модели изображений, а финальные рекламные креативы — на модели более высокого уровня, с теми же метаданными-тегами, которые управляют текстовой маршрутизацией.
Маршрутизация генерации видео по цене и сценарию
Видео — там, где экономия бьёт сильнее всего, потому что разрыв в цене растёт вместе со временем генерации. В каталоге APIMart посекундные цены различаются почти в 5× между самой дешёвой и самой дорогой моделью. Поэтому сопоставление модели со сценарием здесь важнее, чем в любой другой модальности.
| Модель | Прибл. цена/секунда (USD) | Лучше всего для | Уровень роутера | Средняя стоимость/минута |
|---|---|---|---|---|
| MiniMax Hailuo 2.3 | $0.025 | Черновики, соцсети, фоновые лупы | Tier 1 (бюджетный) | ~$1.50 |
| Kling V3 Omni (720p) | $0.0672 | Общий маркетинг, анимации в приложениях | Tier 2 (сбалансированный) | ~$4.03 |
| Sora 2 Preview | $0.08 | Громкие кампании, кинематографичный контент | Tier 3 (премиум) | ~$4.80 |
| Vidu Q3 Pro | $0.12 | Телереклама, флагманские запуски | Tier 3 (премиум) | ~$7.20 |
Возьмём SaaS-компанию из США. Она может направлять все обучающие видео внутри приложения на MiniMax Hailuo 2.3 с тегом "use_case": "tutorial", оставляя Veo 3.1 или Vidu Q3 Pro для небольшого числа флагманских роликов в месяц. Это переносит основной объём с $7.20 за минуту примерно на $1.50 за минуту.
Сценарии месячного бюджета для команд из США
Когда правила маршрутизации настроены, следующий вопрос прост: сколько команда может произвести при фиксированном месячном бюджете?
Рассмотрим рекламное агентство из США с бюджетом на видео $10,000/месяц в APIMart:
- Без маршрутизации (всё на Vidu Q3 Pro): при $7.20/мин на $10,000 выходит примерно 1,389 минут (~83,340 секунд) видео.
- Микс, навязанный роутером (60% MiniMax / 25% Kling / 15% Sora + Vidu): смешанное среднее падает примерно до $3.00–$3.50/мин, что даёт около 2,850–3,333 минут — примерно 2× объёма при тех же тратах.
Это всё та же арифметика средневзвешенных значений, проявившаяся в месячном бюджете. Заявленные 60% экономии берутся из переноса основного объёма на дешёвые уровни, а не из удешевления какой-то одной модели. А поскольку APIMart сводит все списания по моделям в один счёт в долларах США, финансисты и инженеры могут напрямую сверять логи роутера со строками счёта APIMart, сопоставляя прогнозные и фактические расходы.
Внедрение, измерения и главные выводы
Простая продакшен-архитектура для инференса через роутер
Когда правила маршрутизации заданы, следующий шаг прост: выкатить и измерить.
Чтобы добавить маршрутизацию, не нужно перестраивать стек. Отправляйте каждый AI-запрос на POST /v1/route с типом задачи, целевой задержкой, уровнем пользователя и промптом. Cursor Router выбирает модель и возвращает ответ через единый API APIMart.
Картина «до/после» делает компромисс наглядным:
| Аспект профиля | До роутера (одна флагманская модель) | После роутера (уровни моделей через APIMart) |
|---|---|---|
| Средняя задержка (мс) | 900 | 750 |
| Средняя стоимость запроса (USD) | $0.020 | $0.008 |
| Инженерная сложность | Несколько интеграций, свои ретраи | Единый API, централизованные политики |
Логируйте модель, токены, задержку, стоимость в USD и исход через OpenTelemetry, Prometheus и ваш стек дашбордов.[10][11] В большинстве развёртываний маршрутизация по правилам добавляет менее 5 мс накладных расходов, так что сам роутер не должен превращаться в узкое место.[9]
Как подтвердить экономию, не потеряв качество
Когда роутер запущен, сверьте экономию с текущей базой, прежде чем пропускать через него больше трафика.
Проведите контролируемое разделение. Оставьте часть продакшен-трафика на полностью флагманской базе, а остальное направьте через Cursor Router. Инструментируйте обе группы одинаково, затем сравните четыре метрики:
- Доля принятых ответов
- Доля ретраев
- Стоимость на фичу в USD
- Соблюдение SLA, включая задержку p95 и p99 относительно ваших целей
Начните с детерминированных правил на низкорисковом трафике. Короткие промпты можно отправлять на модели среднего уровня. Внутренние инструменты — на бюджетные. Платёжные и комплаенс-потоки должны оставаться на флагманских моделях. Когда телеметрия покажет стабильные доли принятия и ретраев, ужесточайте пороги и распространяйте маршрутизацию на новые фичи.
Если какой-то сегмент отстаёт от базы по качеству, верните его на премиальную модель. Вот и весь цикл: измеряй, корректируй, расширяй.
Заключение: что запомнить о Cursor Router и заявленных 60% экономии
Если цифры подтверждаются в продакшене, расширяйте маршрутизацию шаг за шагом на новые нагрузки.
Бенчмарки показывают, что многоуровневая маршрутизация может снизить стоимость примерно до 42% от базовой, одновременно уменьшая задержку.[5] Единый API APIMart делает это реализуемым: одна точка интеграции, единая отчётность по использованию и цены в USD. Это значит, что Cursor Router может переключать модели без дополнительной инженерной работы с вашей стороны. Относитесь к цифре 60% как к цели для проверки, а не гарантии. Подтвердите её параллельным сравнением стоимости и качества со своей базой, а затем расширяйте внедрение, когда данные скажут, что пора.
Частые вопросы
Как Cursor Router решает, какую модель использовать?
Cursor Router смотрит на каждый запрос, взвешивает, насколько сложна задача и сколько она должна стоить, а затем отправляет её в наиболее подходящую модель.
Он делает это через шаг маршрутизации или классификации. Проще говоря, он сортирует работу — суммаризацию, классификацию, продвинутые рассуждения — прежде чем решить, куда должен уйти запрос.
Так более сложный запрос попадает в премиальную модель, а рутинный трафик — в дешёвый вариант. Благодаря этому дорогие модели остаются сфокусированными на тех 5–15% задач, которым их мощность нужна больше всего.
Когда запрос стоит эскалировать на модель более высокого уровня?
Эскалируйте запрос, когда дешёвая модель не достигает нужного порога уверенности или когда задача требует более глубоких рассуждений — продвинутого программирования, творческого письма или анализа с высокими ставками.
Используйте эскалацию и как резерв: если основная модель сталкивается с проблемами производительности, скачками задержки или сбоями.
Если логи показывают, что дешёвая модель эскалирует более 30% запросов, пересмотрите логику маршрутизации.
Как командам тестировать маршрутизацию без потери качества?
Начните с текущей премиальной модели как базы и по стоимости, и по качеству. Это даёт чистую точку сравнения до любых изменений.
Дальше протестируйте многоуровневую маршрутизацию. Отправьте небольшой контролируемый срез трафика на дешёвые модели, по-прежнему оставляя премиальную модель для критически важной работы. Это простой способ сократить траты, не рискуя самыми важными задачами.
В стейджинге постройте цепочку резервных вариантов и намеренно протестируйте её. Провоцируйте ошибки или отзывайте API-ключи, чтобы убедиться, что запросы переключаются между моделями так, как вы ожидаете. После этого внимательно следите за долей успешных запросов и задержкой. Эти цифры покажут, где ваши правила маршрутизации работают, а где требуют доработки.
Выберите нужную модель в маркетплейсе моделей
Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.