
Inkling-Small 오픈 소스 AI 모델 완벽 해설
Thinking Machines의 276B 멀티모달 MoE인 Inkling-Small을 살펴보세요. 12B 활성 매개변수, 1M 토큰 컨텍스트, 공개 가중치, 유연한 배포 방식을 자세히 설명합니다.
많은 최상위 시스템과 같은 비용을 들이지 않고 긴 입력을 처리할 수 있는 오픈 모델을 원한다면 Inkling-Small이 주목할 대상입니다. 2026년 칠월 30일, Thinking Machines는 요청당 12 billion개의 활성 매개변수만 사용하는 276-billion-parameter 멀티모달 MoE 모델을 공개했습니다. 이 모델은 1 million-token 컨텍스트 윈도와 Apache 2.0 라이선스도 제공합니다.
핵심만 간단히 정리하면 다음과 같습니다.
- 텍스트, 이미지, 오디오를 함께 사용할 수 있습니다.
- 텍스트, 코드, JSON 형식으로 결과를 받을 수 있습니다.
- 사고 노력 수준을 0.2에서 0.99까지 조절해 비용과 추론 깊이의 균형을 맞출 수 있습니다.
- 자체 호스팅하면 전체 1,000,000-token 컨텍스트 윈도를 사용할 수 있습니다.
- 호스팅 방식으로 사용하려면 **Tinker**를 이용할 수 있으며, 컨텍스트는 256,000-token으로 제한됩니다.
- **Hugging Face**에서 오픈 가중치를 다운로드할 수 있습니다.
- NVIDIA GPU에서 4-bit NVFP4 버전을 사용할 수 있습니다.
- 비공개 데이터로 미세 조정하고 자체 환경에서 실행할 수 있습니다.
몇 가지 수치가 특히 눈에 띕니다. Inkling-Small은 **SWE-bench Verified에서 77.6%**를 기록했고, Terminal Bench 2.1에서는 Nemotron 3 Ultra와 같은 수준의 성능을 약 삼분의 일에 해당하는 토큰 비용으로 달성했습니다. 또한 **StrongREJECT에서 98.6%**를 기록했습니다. 이름에는 _Small_이 들어가지만, 실제로는 본격적인 코딩, 문서 작업, 지원 흐름, 에이전트 작업을 겨냥한 모델입니다.
전혀 작지 않은 Inkling-Small: 276B 모델 테스트
빠른 비교
| 영역 | Inkling-Small | Tinker 액세스 |
|---|---|---|
| 액세스 유형 | 자체 호스팅 오픈 가중치 | 호스팅 API |
| 라이선스 | Apache 2.0 | 관리형 서비스 |
| 최대 컨텍스트 | 1,000,000 tokens | 256,000 tokens |
| 입력 | 텍스트, 이미지, 오디오 | 텍스트, 이미지, 오디오 |
| 출력 | 텍스트, 코드, JSON | 텍스트, 코드, JSON |
| 제어 수준 | 인프라와 모델을 완전히 제어 | 설정 작업 감소 |
| 미세 조정 | 가능 | 가능 |
핵심 판단: 이번 릴리스는 폐쇄형 API에 종속되지 않으면서 더 저렴한 배포, 비공개 환경 구성, 장문 컨텍스트 멀티모달 작업을 원하는 미국 팀에게 뚜렷한 선택지를 제공합니다.
Inkling-Small 개요: 아키텍처, 규모, 기능
Inkling-Small은 276 billion개의 전체 매개변수와 토큰당 약 12 billion개의 활성 매개변수를 갖춘 디코더 전용 Mixture-of-Experts(MoE) 트랜스포머입니다. 비교하면 플래그십 모델은 975 billion개의 전체 매개변수와 토큰당 41 billion개의 활성 매개변수를 갖추고 있습니다 [2][1][3]. 이 차이는 중요합니다. 까다로운 작업을 처리하면서도 Inkling-Small을 더 가볍게 다룰 수 있는 이유를 설명해 주기 때문입니다. 멀티모달 입력 지원과 긴 컨텍스트 윈도에서 이러한 특징이 가장 분명하게 드러납니다.
멀티모달 입력, 텍스트 출력, 장문 컨텍스트 지원
Inkling-Small은 텍스트, 이미지, 오디오를 입력으로 받고 자연어, 코드, JSON을 포함한 텍스트 결과를 반환합니다 [2][1]. 텍스트, 이미지, 오디오, 비디오에 걸친 45 trillion tokens 규모의 멀티모달 데이터로 사전 학습되었습니다 [1][3].
또한 최대 1 million tokens의 컨텍스트 윈도를 지원합니다 [1]. 대규모 코드베이스, 긴 문서, 장시간 기록을 다루는 팀에게는 매우 중요한 기능입니다. 자료를 작은 조각으로 나눈 뒤 내용이 빠지지 않기를 바라는 대신, 모델에 훨씬 더 완전한 전체 맥락을 한 번에 전달할 수 있습니다. 자체 호스팅, 미세 조정, 도구를 통한 모델 사용을 검토할 때 특히 의미가 있습니다.
벤치마크 성능과 ‘Small’의 실제 의미
벤치마크 결과를 보면 _Small_이라는 이름을 제대로 이해할 수 있습니다.
SWE-bench Verified에서 Inkling-Small은 **77.6%**를 기록해 Nvidia의 Nemotron 3가 기록한 **71.9%**를 앞섰습니다 [2]. Terminal Bench 2.1에서는 Nemotron 3 Ultra와 같은 수준의 성능을 약 삼분의 일에 해당하는 토큰 비용으로 달성했습니다 [1][3]. StrongREJECT에서는 **98.6%**를 기록해 강력한 거부 처리 능력을 보여 주었습니다 [2].
간단히 말해 _Small_은 성능이 약하다는 뜻이 아닙니다. 실제 작업에서 MoE 구성과 장문 컨텍스트 지원은 팀이 중요하게 여기는 코드 검토, 문서 분석, 에이전트 워크플로에 강점을 보입니다.
Inkling-Small 이용 방법: 가중치, 도구, 통합 옵션

오픈 가중치, 모델 카드, 다운로드 파일
Inkling-Small의 가중치는 Hugging Face의 thinkingmachines 조직에서 공개적으로 제공됩니다 [2][6].
이번 릴리스에는 대부분의 팀이 기대하는 핵심 파일인 가중치, 모델 카드, 토크나이저, 구성 파일, 모달리티 인코더가 포함되어 있습니다 [4][2]. 따라서 처음부터 모든 것을 만들거나 수작업으로 조립할 필요가 없습니다.
NVIDIA GPU에 배포한다면 해당 환경에서 더 나은 성능을 제공하는 Inkling-Small-NVFP4라는 4-bit 양자화 버전도 있습니다 [4][5]. 자체 호스팅을 맡기 전에 모델을 시험하려는 팀에게는 Tinker가 가장 빠른 시작 방법입니다.
자체 호스팅, 호스팅 API, 미세 조정 비교
Thinking Machines는 개발자가 모델을 시험하고, 응답 길이를 제한하고, 웹 검색을 켜고, 엔터프라이즈급 미세 조정을 실행할 수 있는 테스트 및 미세 조정 API인 Tinker를 제공합니다 [2][1].
Tinker는 주요 추론 및 배포 도구와 출시 당일부터 통합됩니다 [6][1]. 모델 자체는 전체 작업의 일부에 불과하므로 중요한 부분입니다. 복잡한 설정 작업 없이 실제 스택에 연결할 경로도 필요합니다.
장단점은 간단합니다.
- 자체 호스팅은 모든 제어 권한과 1 million-token 컨텍스트 윈도 사용 권한을 제공합니다 [6][1].
- Tinker는 운영 작업을 줄여 주지만 컨텍스트는 256,000 tokens로 제한됩니다 [6][1].
결국 선택 기준은 속도와 제어 수준입니다. 관리형 액세스와 적은 인프라 작업을 원한다면 Tinker가 쉬운 경로입니다. 전체 컨텍스트 윈도와 더 세밀한 배포 제어가 필요하다면 자체 호스팅이 더 적합합니다.
멀티모달 프로덕션 워크플로에서 APIMart의 역할

팀이 액세스 방식을 선택한 뒤에도 여러 멀티모달 요청을 하나의 깔끔한 워크플로로 처리하는 실무 과제가 남습니다.
같은 흐름에서 분석과 생성이 모두 필요한 팀을 위해 APIMart는 멀티모달 API를 위한 단일 통합 계층을 제공합니다.
미국 팀을 위한 활용 사례와 비용 효율적인 배포
코딩 어시스턴트, 에이전트, 지원 도구, 문서 분석
이용 방법을 파악했다면 다음 질문은 간단합니다. Inkling-Small은 어떤 작업에서 가장 큰 힘을 발휘할까요? MoE 설계는 대규모 프로덕션 작업에서 추론 부담을 낮추는 데 도움이 됩니다 [1].
소프트웨어 팀에게는 대규모 코드베이스를 다뤄야 하는 저장소 수준의 버그 수정, PR 검토, 다단계 코딩 에이전트에 적합합니다 [2].
동일한 구성은 빠른 분류와 장문 컨텍스트 읽기가 필요한 작업에도 효과적입니다. 티켓 분류, 정책 관련 질문 답변, 적절한 담당자에게 에스컬레이션을 보내는 지원 코파일럿을 떠올릴 수 있습니다. 규모가 커지면 지연 시간과 연산량의 작은 개선도 빠르게 누적됩니다.
계약서, 정책 파일, 기술 매뉴얼을 포함한 대형 문서 분석에도 적합합니다 [1]. 팀에서 복잡한 문서를 매일 다룬다면 장문 컨텍스트 읽기의 가치가 드러나는 작업입니다.
교육 플랫폼에서는 조절 가능한 사고 노력 수준을 활용해 Inkling-Small로 수학과 논리 튜터링을 제공할 수 있습니다 [2]. 매번 같은 연산 비용을 지불하는 대신 작업에 맞춰 모델의 노력 수준을 조절할 수 있습니다.
대표적인 활용 분야는 다음과 같습니다.
- 코딩 에이전트
- 지원 코파일럿
- 문서 분석
- 튜터링
- 멀티모달 태깅
미국 팀을 위한 비용, 지연 시간, 예산 계획
여기서 가장 중요한 비용 조절 수단은 MoE 설계입니다. 반복 요청에서 추론 비용과 지연 시간을 낮추는 데 도움이 됩니다 [1].
개발자는 간단한 작업을 위한 0.2부터 더 어려운 추론을 위한 0.99까지 코드에서 사고 노력 수준을 조절할 수도 있습니다 [2]. 쉽게 말해 대량의 단순 작업에는 연산을 덜 쓰고, 실제로 필요한 사례에 더 많은 사고 시간을 배분할 수 있습니다.
미국 팀 전체의 지출을 계획할 때 이러한 제어 기능은 중요합니다. 매일 수천 건의 일상적인 요청을 처리하는 지원 흐름에는 복잡한 예외 상황을 해결하는 코딩 에이전트와 같은 설정이 필요하지 않습니다. 하나의 모델에서 서로 다른 노력 수준을 적용해 예산을 더 명확하게 관리할 수 있습니다.
이 모델은 Apache 2.0 라이선스로 공개되므로 데이터 제어가 중요할 때 미국 팀이 온프레미스 또는 VPC 내부에서 실행할 수도 있습니다 [2][1].
이러한 배포 옵션은 다음 섹션의 연구 핵심 내용으로 이어집니다.
연구 핵심 내용과 최종 요약
오픈 가중치 공개가 테스트와 맞춤화에 중요한 이유
액세스와 배포를 모두 살펴본 뒤 남는 핵심 연구 관점은 오픈 가중치를 통해 팀이 실제로 무엇을 할 수 있는지입니다.
가중치가 공개되어 연구자는 아키텍처와 추론 제어 기능을 직접 살펴볼 수 있습니다. 또한 내부 데이터를 외부 API로 보내지 않고 자체 데이터로 모델을 테스트할 수 있습니다. 이러한 가시성은 안전성 테스트에도 도움이 됩니다. 공개된 주장을 그대로 받아들이는 대신 조직이 자체 인프라에서 결과를 검증할 수 있습니다.
도메인 적응도 큰 장점입니다. 금융 분석이나 소프트웨어 엔지니어링 같은 분야의 팀은 범용 시스템에만 의존하지 않고 독점 데이터로 모델을 미세 조정할 수 있습니다 [2]. 이러한 개방성은 로컬 배포와 도메인별 적응도 지원하므로 팀이 자체 조건에 따라 독립적인 감사를 수행할 수 있습니다.
기억해야 할 핵심 사항
가장 중요한 내용은 다음과 같습니다.
- 오픈 가중치를 통해 팀은 자체 인프라에서 모델을 테스트하고, 미세 조정하고, 벤치마크할 수 있습니다.
- 가중치는 Hugging Face에서 제공되며, Tinker를 사용하면 프로덕션으로 이동하기 전에 여러 설정을 집중적으로 시험할 수 있습니다 [2][1].
- Inkling-Small은 통제 가능하고 비용에 민감한 배포를 위해 설계되었으며, 오픈 가중치가 테스트, 미세 조정, 독립적인 벤치마킹을 지원합니다.
제어, 맞춤화, 독립적인 검증이 필요한 팀에게 이러한 구성은 Inkling-Small을 실용적인 선택지로 만들어 줍니다.
자주 묻는 질문
Inkling-Small을 자체 호스팅하려면 어떤 하드웨어가 필요한가요?
Inkling-Small은 276-billion-parameter 아키텍처를 기반으로 하며 NVIDIA Blackwell 시스템용 네이티브 NVFP4 양자화 체크포인트를 사용합니다.
환경에서는 SGLang, vLLM, TokenSpeed, llama.cpp 같은 오픈 소스 추론 라이브러리도 지원해야 합니다. Thinking Machines는 개발 중 GB300 NVL72 시스템을 사용했지만, Small 변형은 로컬 배포를 위한 더 비용 효율적이고 지연 시간이 짧은 선택지로 설계되었습니다.
Tinker 대신 자체 호스팅을 사용해야 하는 경우는 언제인가요?
조직에서 에이전틱 AI 워크로드를 완전히 제어해야 한다면 자체 호스팅을 사용하세요. 온프레미스나 가상 사설 클라우드에서 모델을 실행하고 팀이 설정과 일상적인 운영을 직접 관리하는 경우가 이에 해당합니다.
자체 인프라를 관리하거나 지속적인 토큰 비용을 줄이거나 특정 데이터 개인정보 보호 요구 사항을 충족하려는 팀에도 적합합니다.
연구와 미세 조정을 위한 편리하고 진입 장벽이 낮은 환경을 원한다면 Tinker가 더 나은 선택입니다. 자체 호스팅을 사용하면 자체 하드웨어에 맞춰 성능과 비용을 더 자유롭게 조정할 수 있습니다.
사고 노력 수준은 비용과 응답 품질에 어떤 영향을 주나요?
Inkling의 조절 가능한 사고 노력 수준을 사용하면 개발자가 모델의 추론 예산을 0.2에서 0.99까지 간편하게 조정할 수 있습니다. 높은 설정은 복잡한 다단계 추론에 더 많은 연산을 사용합니다. 낮은 설정은 간단한 작업에서 토큰 사용량과 지연 시간을 줄입니다.
Inkling은 사고 연쇄 추론을 압축하므로 더 적은 토큰으로도 정확한 결과에 도달할 수 있습니다. 이를 통해 사용자는 배포 요구 사항에 맞춰 비용과 성능을 더 세밀하게 제어할 수 있습니다.
모델 마켓에서 원하는 모델을 선택하세요
APIMart 모델 마켓에서 채팅, 이미지, 비디오 모델을 사용해 보고 하나의 통합 API로 모델 기능을 빠르게 경험하세요.