
Обзор открытой ИИ-модели Inkling-Small
Обзор Inkling-Small — мультимодальной MoE-модели Thinking Machines с 276B параметров, 12B активных параметров, контекстом 1M токенов, открытыми весами и гибким развёртыванием.
Если вам нужна открытая модель, способная обрабатывать длинные входные данные дешевле многих ведущих систем, обратите внимание на Inkling-Small. 30 июля 2026 года Thinking Machines выпустила мультимодальную MoE-модель с 276 миллиардами параметров, из которых при каждом запросе активны лишь 12 миллиардов, контекстным окном в 1 миллион токенов и лицензией Apache 2.0.
Краткое описание:
- Модель принимает текст, изображения и аудио
- Я получаю результаты в виде текста, кода и JSON
- Можно настроить интенсивность рассуждения от 0.2 до 0.99, балансируя стоимость и глубину вывода
- Модель можно разместить самостоятельно, получив полное контекстное окно в 1,000,000 токенов
- Для размещённого доступа можно использовать Tinker, но с ограничением контекста в 256,000 токенов
- Открытые веса доступны для загрузки на Hugging Face
- На графических процессорах NVIDIA можно использовать 4-битную версию NVFP4
- Модель можно дообучать на частных данных и запускать в собственной среде
Особенно выделяются несколько показателей. Inkling-Small набрала 77.6% в SWE-bench Verified, сравнялась с Nemotron 3 Ultra в Terminal Bench 2.1, используя примерно треть стоимости токенов, и получила 98.6% в StrongREJECT. Поэтому, хотя в названии есть слово Small, модель рассчитана на серьёзные задачи программирования, работу с документами, поддержку и агентные сценарии.
Inkling-Small совсем не мала: тестируем модель 276B
Краткое сравнение
| Область | Inkling-Small | Доступ через Tinker |
|---|---|---|
| Тип доступа | Самостоятельное размещение открытых весов | Размещённый API |
| Лицензия | Apache 2.0 | Управляемый сервис |
| Максимальный контекст | 1,000,000 токенов | 256,000 токенов |
| Входные данные | Текст, изображения, аудио | Текст, изображения, аудио |
| Выходные данные | Текст, код, JSON | Текст, код, JSON |
| Контроль | Полный контроль инфраструктуры и модели | Меньше работы по настройке |
| Дообучение | Да | Да |
Мой вывод: этот выпуск даёт командам из США понятный вариант для более дешёвого развёртывания, частной среды и мультимодальных задач с длинным контекстом без привязки к закрытому API.
Обзор Inkling-Small: архитектура, размер и возможности
Inkling-Small — декодерный трансформер с архитектурой Mixture-of-Experts (MoE), 276 миллиардами общих параметров и примерно 12 миллиардами активных параметров на токен. Для сравнения, флагманская модель содержит 975 миллиардов общих параметров и 41 миллиард активных параметров на токен [2][1][3]. Эта разница имеет значение. Она объясняет, почему Inkling-Small ощущается легче в работе, продолжая справляться со сложными задачами. Особенно наглядно это проявляется в поддержке мультимодальных входных данных и длинного контекстного окна.
Мультимодальные входные данные, текстовые результаты и длинный контекст
Inkling-Small принимает текст, изображения и аудио, а возвращает текстовые результаты, включая естественный язык, код и JSON [2][1]. Модель была предварительно обучена на 45 триллионах токенов мультимодальных данных, включающих текст, изображения, аудио и видео [1][3].
Она также поддерживает контекстное окно до 1 миллиона токенов [1]. Это особенно важно для команд, работающих с крупными кодовыми базами, длинными документами или продолжительными расшифровками. Вместо деления материалов на крошечные фрагменты с риском потери связей модель может сразу получить гораздо более полную картину. Эта возможность часто оказывается решающей при выборе между самостоятельным размещением, дообучением и использованием через инструменты.
Результаты тестов и истинный смысл слова «Small»
Результаты тестов помогают правильно оценить название Small.
В SWE-bench Verified Inkling-Small набрала 77.6%, опередив Nvidia Nemotron 3 с результатом 71.9% [2]. В Terminal Bench 2.1 она сравнялась с Nemotron 3 Ultra, используя примерно треть стоимости токенов [1][3]. Кроме того, модель получила 98.6% в StrongREJECT, что указывает на эффективную обработку отказов [2].
Проще говоря, Small не означает слабую модель. На практике архитектура MoE и поддержка длинного контекста проявляются в важных для команд задачах: проверке кода, анализе документов и агентных рабочих процессах.
Как получить Inkling-Small: веса, инструменты и варианты интеграции

Открытые веса, карточка модели и загружаемые файлы
Веса Inkling-Small находятся в открытом доступе на Hugging Face в организации thinkingmachines [2][6].
В выпуск входят основные файлы, которые обычно нужны командам: веса, карточка модели, токенизатор, файлы конфигурации и кодировщики модальностей [4][2]. Поэтому начинать с нуля или вручную собирать всё по частям не придётся.
Для развёртывания на графических процессорах NVIDIA также доступна 4-битная квантованная версия Inkling-Small-NVFP4, обеспечивающая лучшую производительность в такой конфигурации [4][5]. Если команда хочет попробовать модель до перехода к самостоятельному размещению, Tinker станет самым быстрым вариантом.
Самостоятельное размещение, размещённые API и дообучение: сравнение
Thinking Machines предлагает Tinker — API для тестирования и дообучения, который позволяет разработчикам попробовать модель, ограничить длину ответа, включить веб-поиск и провести дообучение корпоративного уровня [2][1].
Tinker также с первого дня поддерживает интеграции с основными инструментами вывода и развёртывания [6][1]. Это важно, поскольку сама модель — лишь часть задачи. Кроме неё нужен способ включить модель в рабочий стек без большого объёма настройки.
Компромисс довольно прост:
- Самостоятельное размещение даёт полный контроль и доступ к контекстному окну в 1 миллион токенов [6][1].
- Tinker сокращает операционную нагрузку, но ограничивает контекст до 256,000 токенов [6][1].
Таким образом, выбор сводится к скорости или контролю. Если вам нужен управляемый доступ с меньшим объёмом инфраструктурных работ, Tinker будет простым решением. Если необходимы полное контекстное окно и более строгий контроль развёртывания, разумнее выбрать самостоятельное размещение.
Роль APIMart в мультимодальных производственных процессах

После выбора способа доступа остаётся практическая часть производства: организация прохождения мультимодальных запросов через единый понятный рабочий процесс.
Для команд, которым нужны анализ и генерация в одном потоке, APIMart предоставляет единый уровень интеграции мультимодальных API.
Сценарии использования и экономичное развёртывание для команд из США
Помощники программиста, агенты, инструменты поддержки и анализ документов
Когда способ доступа понятен, следующий вопрос очевиден: в каких задачах Inkling-Small наиболее эффективна? Благодаря архитектуре MoE вывод остаётся экономным при производственных нагрузках большого объёма [1].
Для команд разработчиков это делает модель подходящей для исправления ошибок на уровне репозитория, проверки PR и многоэтапных агентов программирования, работающих с крупными кодовыми базами [2].
Такая же конфигурация подходит для задач, требующих быстрой классификации и чтения длинного контекста. Например, помощники службы поддержки могут сортировать обращения, отвечать на вопросы о политиках и направлять эскалации нужным специалистам. В большом масштабе даже небольшое сокращение задержки и вычислений быстро даёт заметный эффект.
Модель также подходит для анализа больших документов, включая договоры, политики и технические руководства [1]. Если команда ежедневно работает с насыщенными документами, именно в такой нагрузке чтение длинного контекста становится особенно ценным.
На образовательных платформах Inkling-Small может обеспечивать обучение математике и логике с регулируемой интенсивностью рассуждения [2]. Команды смогут подбирать усилия модели под задачу, а не платить одинаковую стоимость вычислений при каждом запросе.
Типичные сценарии включают:
- Агенты программирования
- Помощники службы поддержки
- Анализ документов
- Обучение
- Мультимодальная разметка
Стоимость, задержка и планирование бюджета для команд из США
Главный фактор стоимости здесь — архитектура MoE. Она помогает снизить стоимость и задержку вывода для повторяющихся запросов [1].
Разработчики также могут программно настраивать интенсивность рассуждения: от 0.2 для простых задач до 0.99 для более сложных рассуждений [2]. Иными словами, команды могут расходовать меньше вычислительных ресурсов на массовые задачи низкой сложности, сохраняя больше времени рассуждения для действительно трудных случаев.
Такой контроль важен при планировании расходов команды из США. Потоку поддержки, обрабатывающему тысячи обычных запросов в день, не нужна та же настройка, что агенту программирования, разбирающему сложные пограничные случаи. Одна модель, разные уровни усилий и более понятное управление бюджетом.
Поскольку модель выпущена по лицензии Apache 2.0, команды из США также могут запускать её локально или внутри VPC, если контроль данных является приоритетом [2][1].
Эти варианты развёртывания подводят нас к исследовательским выводам следующего раздела.
Исследовательские выводы и итоговое резюме
Почему открытый выпуск весов важен для тестирования и настройки
После рассмотрения доступа и развёртывания главный исследовательский вопрос сводится к тому, что именно открытые веса дают командам на практике.
Открытые веса позволяют исследователям напрямую изучать архитектуру и управление рассуждением. Они также могут тестировать модель на внутренних данных, не отправляя их через внешний API. Такая прозрачность полезна и для проверки безопасности. Вместо безоговорочного принятия опубликованных утверждений организации могут проверить результаты в собственной инфраструктуре.
Адаптация к предметной области — ещё одно серьёзное преимущество. Команды в финансовом анализе или разработке программного обеспечения могут дообучать модель на собственных данных, а не полагаться на универсальную систему [2]. Эта же открытость поддерживает локальное развёртывание и адаптацию к конкретной области, позволяя командам проводить независимый аудит на собственных условиях.
Основные выводы
Наиболее важны следующие моменты:
- Открытые веса позволяют командам тестировать, дообучать и оценивать модель в собственной инфраструктуре.
- Веса доступны на Hugging Face, а Tinker позволяет тщательно проверить настройки до перехода в рабочую среду [2][1].
- Inkling-Small предназначена для контролируемого и чувствительного к стоимости развёртывания, а открытые веса поддерживают тестирование, дообучение и независимую оценку.
Для команд, которым необходимы контроль, настройка и независимая проверка, такая конфигурация делает Inkling-Small практичным выбором.
Часто задаваемые вопросы
Какое оборудование нужно для самостоятельного размещения Inkling-Small?
Inkling-Small построена на архитектуре с 276 миллиардами параметров и использует собственные квантованные контрольные точки NVFP4 для систем NVIDIA Blackwell.
Ваша среда также должна поддерживать библиотеки вывода с открытым исходным кодом, такие как SGLang, vLLM, TokenSpeed или llama.cpp. Хотя Thinking Machines при разработке использовала системы GB300 NVL72, вариант Small задуман как более экономичный и быстрый выбор для локального развёртывания.
Когда выбирать самостоятельное размещение вместо Tinker?
Выбирайте самостоятельное размещение, если вашей организации нужен полный контроль над агентными нагрузками ИИ. Это может означать запуск моделей локально или в виртуальном частном облаке, при котором команда отвечает за настройку и ежедневную эксплуатацию.
Такой вариант также подходит командам, желающим управлять собственной инфраструктурой, сокращать постоянные расходы на токены или выполнять определённые требования к конфиденциальности данных.
Tinker лучше подойдёт, если вам нужна удобная среда с минимальными сложностями для исследований и дообучения. Самостоятельное размещение предоставляет больше возможностей оптимизировать производительность и стоимость под собственное оборудование.
Как интенсивность рассуждения влияет на стоимость и качество ответа?
Управляемая интенсивность рассуждения Inkling позволяет разработчикам регулировать бюджет рассуждения модели от 0.2 до 0.99. Более высокие значения задействуют больше вычислений для сложного многоэтапного вывода. Более низкие сокращают расход токенов и задержку в простых задачах.
Поскольку Inkling сжимает рассуждения цепочки мыслей, она часто достигает точных результатов с меньшим числом токенов. Пользователи получают больше контроля над стоимостью и производительностью в соответствии с требованиями развёртывания.
Выберите нужную модель в маркетплейсе моделей
Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.