Inkling-Small 소개
Thinking Machines Lab이 2026년 7월 30일, 총 276B(활성 12B) 파라미터 규모의 오픈 웨이트(open-weights) 멀티모달 모델 Inkling-Small 을 Apache 2.0 라이선스로 정식 공개했습니다. 핵심 주장은 간결합니다. 같은 패밀리의 형 모델 Inkling(총 975B, 활성 41B)의 4분의 1 크기로 대등한 성능 을 낸다는 것입니다. 실제로는 추론(reasoning)과 에이전틱 코딩에서는 형을 앞서고, 지식 범위와 사실성에서는 뒤처지는 형태로 갈립니다.
보름 전 Inkling이 공개될 때 Inkling-Small은 프리뷰(preview) 상태로만 언급되었습니다(관련 내용은 PyTorchKR에 정리한 Inkling 소개 글을 참고해 주세요). 당시 Thinking Machines Lab은 테스트를 마무리하는 대로 전체 가중치를 공개하겠다고 밝혔는데, 이번 릴리스가 그 약속을 이행한 것입니다. 다만 프리뷰 체크포인트를 그대로 내놓은 것이 아니라, 그 위에 에이전틱 코딩 강화 학습을 2주 더 얹은 결과물이라는 점이 중요합니다. 뒤에서 살펴볼 것처럼 이 2주가 특정 벤치마크에서 두 자릿수 점수 차를 만들었습니다.
Inkling-Small이 흥미로운 이유는 단순히 "작은 모델도 쓸 만하다"가 아닙니다. Inkling-Small은 형보다 늦게 학습을 시작했고, 그 덕에 사전 학습 데이터 배합과 머신러닝 레시피를 개선할 수 있었습니다. 여기에 Inkling을 교사(teacher)로 삼은 온폴리시 증류(On-Policy Distillation) 를 프리뷰 체크포인트의 사후 학습에 일부 사용했습니다. 즉 이 모델은 축소판이 아니라, 큰 형에게서 배우고 더 나은 레시피로 다시 만든 후속 모델입니다. 모델 패밀리를 순차적으로 확장하는 조직에서 나중에 만든 작은 모델이 먼저 만든 큰 모델을 특정 축에서 추월하는 현상은 Inkling 공개 당시에도 이미 관찰된 바 있는데, 정식 릴리스에서 그 격차가 더 벌어졌습니다.
실용적인 관점에서 가장 크게 달라진 것은 접근성 입니다. Inkling의 BF16 체크포인트는 2TB의 통합 VRAM을 요구해 개인이나 소규모 팀이 직접 돌리기 어려웠지만, Inkling-Small의 NVFP4 체크포인트는 최소 180GB, 즉 NVIDIA B300 한 장 으로 구동됩니다. 형과 마찬가지로 최대 100만(1M) 토큰 컨텍스트, 오디오와 이미지에 대한 네이티브 추론, 조절 가능한 사고 노력(thinking effort)을 모두 갖추고 있습니다.
한눈에 보는 Inkling-Small
- 모델 유형: 멀티모달 자기회귀(Autoregressive) 트랜스포머, 42층 디코더 전용(decoder-only) 구조
- 파라미터: 총 276B, 토큰당 활성 12B (전문가 혼합, Mixture-of-Experts)
- MoE 구성: 256개 라우팅 전문가 중 토큰당 6개 활성화 + 모든 토큰에 적용되는 공유 전문가 2개
- 어텐션: 로컬 층과 글로벌 층의 하이브리드
- 컨텍스트 길이: 최대 100만(1M) 토큰
- 입력 모달리티: 텍스트(UTF-8), 이미지(각 변 40px~4096px 권장), 오디오(16kHz WAV, 2분 이내 권장) / 출력: 텍스트
- 수치 표현(Numerics): BF16, MXFP8, NVFP4 (공개 체크포인트는 BF16과 NVFP4 두 종류)
- 라이선스: Apache 2.0 (별도 Model Acceptable Use Policy 적용)
- 학습 하드웨어: NVIDIA GB300 NVL72 시스템
- 공개일: 2026년 7월 30일
프리뷰에서 정식 공개까지, 2주가 만든 차이
이번 릴리스에서 가장 눈여겨볼 대목은 원문 블로그가 직접 표로 제시하지 않은 부분, 즉 프리뷰 시점과 정식 릴리스 시점의 점수 차이 입니다. Thinking Machines Lab의 설명에 따르면 프리뷰 체크포인트는 Inkling을 교사로 한 온폴리시 증류를 일부 활용해 사후 학습되었고, 그 체크포인트에서 출발해 에이전틱 코딩 강화 학습을 2주간 더 확장(scaling) 했습니다.
아래는 Inkling 공개 시점에 보고된 프리뷰 점수와 이번 정식 릴리스 점수를 나란히 놓은 것입니다. 아래 여덟 개 벤치마크에서 Inkling 자신의 점수는 두 발표에서 한 자리도 바뀌지 않았으므로, 비교의 기준선은 흔들리지 않았습니다.
| 벤치마크 | Inkling-Small (프리뷰) | Inkling-Small (정식) | 변화 | Inkling |
|---|---|---|---|---|
| Terminal Bench 2.1 | 52.7% | 64.7% | +12.0pt | 63.8% |
| SWEBench Verified | 77.4% | 80.2% | +2.8pt | 77.6% |
| HLE (텍스트) | 29.6% | 31.6% | +2.0pt | 29.7% |
| GPQA Diamond | 88.3% | 89.5% | +1.2pt | 87.2% |
| VoiceBench | 90.0% | 90.1% | +0.1pt | 91.4% |
| SimpleQA Verified | 20.9% | 20.6% | -0.3pt | 43.9% |
| IFBench | 83.4% | 82.2% | -1.2pt | 79.8% |
| FORTRESS (adversarial) | 75.6% | 71.6% | -4.0pt | 78.0% |
읽는 방법은 이렇습니다. 2주간의 추가 강화 학습이 집중적으로 겨냥한 에이전틱 코딩(Terminal Bench 2.1 +12.0pt, SWEBench Verified +2.8pt) 에서 뚜렷한 개선이 나타났고, 여기서 프리뷰 시절 형에게 11.1pt 뒤졌던 Terminal Bench 2.1이 오히려 0.9pt 앞서는 위치로 뒤집혔습니다. 추론(HLE, GPQA Diamond)도 함께 올랐습니다. 반면 학습이 겨냥하지 않은 축, 특히 지시 따르기(IFBench)와 안전 거부율(FORTRESS adversarial)은 소폭 하락했습니다. 특정 능력에 강화 학습 컴퓨트를 몰아 주면 다른 축에서 조금씩 대가를 치른다는, 사후 학습의 익숙한 트레이드오프가 그대로 드러납니다.
형 모델의 4분의 1 크기로 같은 자리에 서다
Thinking Machines Lab이 Inkling-Small을 소개하며 가장 앞세우는 것은 절대 점수가 아니라 성능 대비 컴퓨트 곡선 입니다. 두 모델 모두 사고 노력(thinking effort)을 minimal에서 xhigh까지 훑으면(sweep) 하나의 점이 아니라 곡선을 그리는데, 이 곡선의 위치를 비교하면 "같은 컴퓨트로 어느 모델이 더 잘하는가"를 볼 수 있습니다.
아래 그림은 에이전틱 코딩(Terminal-Bench 2.1), 고난도 추론(HLE 텍스트 전용, 도구 없음), 지시 따르기(IFBench) 세 벤치마크에서 두 모델의 곡선을 겹쳐 그린 것입니다. 가로축은 샘플당 출력 TFLOPs로, 2 × 활성 파라미터 × 샘플당 평균 생성 토큰 수로 추정한 값이며 추론 토큰까지 포함합니다. 회색 점들은 비교 대상 오픈 웨이트 모델들입니다.
자주색(Inkling-Small) 곡선이 파란색(Inkling) 곡선보다 왼쪽 위 에 놓여 있다는 것이 이 그림의 요지입니다. 활성 파라미터가 41B에서 12B로 줄었으니 같은 토큰 수를 생성해도 컴퓨트는 약 3분의 1이고, 곡선 전체가 위에 있으니 성능은 대등하거나 더 높습니다. HLE에서는 "모든 사고 예산 구간에서 우위가 유지된다" 는 것이 원문의 표현이고, 실제로 최대 노력 기준 31.6%로 Inkling의 29.7%를 앞섭니다. 하나의 점을 자랑하는 대신 곡선 전체를 보여주는 방식은, 실제 서비스에서 비용과 지연(latency)을 조율해야 하는 개발자에게 훨씬 실용적인 정보입니다.
토큰 효율, 적게 생각하고 같은 답에 도달하기
컴퓨트 축을 활성 파라미터가 아닌 출력 토큰 수 로 바꿔 보면 또 다른 그림이 나옵니다. 추론 모델의 실제 비용과 응답 시간은 결국 몇 개의 토큰을 뱉는지에 달려 있기 때문입니다. 아래는 네 가지 과제에서 성능 대비 출력 토큰 수를 그린 것으로, 점선은 어떤 모델에도 지배되지 않는 파레토 프론티어(Pareto frontier) 입니다.
- GDPval-AA v2: 실제 직업군의 업무 산출물을 평가하는 GDPval 계열 과제를 Elo로 환산한 지표입니다.
- τ³-Banking: 은행 도메인의 다중 턴 도구 사용 과제로, τ-Bench 계열의 후속 버전입니다.
- AA-Briefcase: Artificial Analysis가 자체 개발한 비공개 평가로, 스프레드시트나 프레젠테이션, 메모처럼 실제 업무 산출물을 만들어 내야 하는 장기 지식 노동(long-horizon knowledge work)을 다룹니다.
- CritPt: 연구 수준의 물리 문제를 푸는 벤치마크입니다.
원문의 표현대로 Inkling-Small은 점선이 지나는 자리, 즉 "가장 효율적인 오픈 웨이트 모델 중 하나" 에 해당합니다. GDPval-AA v2에서는 과제당 2만 3천 토큰으로 Elo 1269를 기록해 2만 8천 6백 토큰을 쓴 Inkling(1238)보다 적게 쓰고 더 잘했고, AA-Briefcase에서는 2만 9천 토큰으로 917점을 내며 5만 2천 2백 토큰을 쓴 Inkling(839)을 크게 앞섰습니다. CritPt에서는 10만 1천 토큰으로 8.3%를 기록해 7만 9천 3백 토큰을 쓴 Inkling의 5.4%를 넘었습니다. 다만 이 차트가 말해 주는 것은 효율 이지 절대 점수가 아닙니다. τ³-Banking에서 Inkling-Small은 5천 1백 토큰이라는 가장 적은 예산으로 프론티어 왼쪽 끝에 놓이지만, 점수 자체는 15.5%로 8천 4백 토큰을 쓴 Inkling(23.7%)에 못 미칩니다. 뒤에서 다룰 사실성과 지식 범위의 약점이 드러나는 지점입니다.
열 개 축을 고르게 채운 제너럴리스트
Inkling과 마찬가지로 Inkling-Small도 특정 벤치마크 1위를 노린 모델이 아니라 폭넓게 균형 잡힌 제너럴리스트(Generalist) 를 지향합니다. 아래 레이더 차트에서 진한 자주색 실선이 Inkling-Small이고, 굵은 코발트색 선이 Inkling, 점선들이 비교 모델(DeepSeek V4 Flash, Gemini 3.5 Flash-Lite, GPT 5.6 Luna)입니다. 점수가 보고되지 않은 축은 0으로 찍혀 있습니다.
차트에서 Inkling-Small이 비교 모델들보다 크게 뻗은 축은 AudioMC(오디오)와 IFBench(지시 따르기) 이고, 반대로 가장 깊게 파인 축은 SimpleQA Verified(사실성) 입니다. 이 두 방향이 이 모델의 성격을 요약합니다.
아래는 주요 벤치마크를 오픈 웨이트, 클로즈드 웨이트 모델과 함께 놓은 표입니다. 모든 평가는 사고 노력 0.99, temperature 1.0에서 수행되었고, 코딩 평가는 25만 6천(256K) 토큰의 트래젝토리 상한을 두었습니다. 일관성을 위해 자사 모델과 외부 모델 모두 Artificial Analysis, Scale AI, ARC Prize, Forecasting Research Institute, ProphetArena가 외부 보고한 점수를 우선 채택했습니다.
| 벤치마크 | Inkling-Small | Inkling | DeepSeek V4 Flash | Qwen3.5 397B-A17B | Gemini 3.5 Flash-Lite | GPT 5.6 Luna |
|---|---|---|---|---|---|---|
| 활성 / 총 파라미터 (B) | 12 / 276 | 41 / 975 | 13 / 284 | 17 / 397 | 비공개 | 비공개 |
| AA Index v4.1 | 40.0% | 41.0% | 40.0% | 34.0% | 36.0% | 49.0% |
| SWEBench Verified | 80.2% | 77.6% | 79.0% | 76.4% | 75.0% | 93.0% |
| Terminal Bench 2.1 | 64.7% | 63.8% | 61.8% | 51.3% | 54.0% | 82.5% |
| SciCode | 48.7% | 46.1% | 44.9% | 42.0% | 40.9% | 50.0% |
| GDPval-AA v2 (Elo) | 1269 | 1238 | 1189 | 962 | 1139 | 1530 |
| MCP Atlas (public) | 79.6% | 78.8% | 69.0% | 74.2% | 79.8% | 77.0% |
| Toolathlon Verified | 54.4% | 45.5% | 50.9% | 40.7% | 57.1% | 67.9% |
| GPQA Diamond | 89.5% | 87.2% | 89.4% | 89.3% | 83.8% | 89.5% |
| HLE (텍스트) | 31.6% | 29.7% | 32.1% | 27.3% | 17.5% | 35.6% |
| AIME 2026 | 95.5% | 97.1% | 95.8% | 93.3% | 82.2% | 97.6% |
| CritPt | 8.3% | 5.4% | 7.1% | 1.7% | 0.0% | 20.6% |
| ARC-AGI-2 | 40.1% | 36.5% | 미보고 | 미보고 | 미보고 | 47.6% |
| SimpleQA Verified | 20.6% | 43.9% | 34.1% | 26.0% | 44.1% | 41.7% |
| IFBench | 82.2% | 79.8% | 79.2% | 78.8% | 78.6% | 67.3% |
| Global-MMLU-Lite | 86.7% | 88.7% | 88.4% | 90.0% | 89.4% | 88.7% |
표를 해석할 때 알아 두어야 할 점이 있습니다. SWEBench Verified의 Inkling 계열 점수는 bash 명령만 쓰는 하네스(harness)로 측정한 값이고 외부 모델은 자체 보고 수치입니다. Terminal Bench 2.1은 내부 코딩 하네스로 측정했으며, 웹 검색으로 오염(contamination)된 것으로 확인된 소수의 해답에는 0점을 부여했다고 밝히고 있습니다. 하네스가 결과를 크게 흔든다는 점은 Artificial Analysis의 코딩 에이전트 벤치마크에서도 이미 지적된 바 있으니, 절대 수치보다 경향으로 읽는 편이 안전합니다.
오디오와 비전, 이미지를 직접 확대해 보는 추론
Inkling-Small은 형과 동일한 인코더 프리(encoder-free) 네이티브 멀티모달 아키텍처 를 씁니다. 오디오는 dMel 스펙트로그램으로 표현되고, 이미지는 40x40 픽셀 패치로 나뉘어 4층 hMLP를 통과합니다. 두 신호 모두 가벼운 임베딩 레이어를 거쳐 텍스트 토큰과 함께 하나의 디코더에서 처리됩니다. 별도의 비전 인코더나 오디오 인코더를 앞에 붙이지 않는 이 설계는 Thinking Machines Lab이 앞서 공개한 인터랙션 모델(Interaction Models) 시스템의 설계와 일관됩니다.
오디오 토큰화와 비전 패치 임베딩의 원 논문은 다음과 같습니다:
이번 릴리스에서 새로 개선된 것은 시각 과제에 Python을 쓰는 능력 입니다. Inkling-Small은 시각 추론을 하면서 크롭(crop), 확대(zoom), 프로그램적 이미지 검사 같은 연산을 함께 수행할 수 있습니다. 문서나 차트처럼 필요한 정보가 작게 박혀 있어 눈으로 바로 읽기 어려운 입력에서 이 능력이 유용합니다. 실제로 CharXiv RQ 점수는 원본 이미지만 볼 때 77.4%인데 Python을 함께 쓰면 81.3%로 올라갑니다. 참고로 모델 카드는 긴 변이 2048px보다 작은 입력 이미지에 대해서는 긴 변을 2048px 또는 원본의 2배 중 작은 값으로 확대한다고 밝히고 있습니다.
아래는 오픈 웨이트, 클로즈드 웨이트 전문 옴니(omni) 모델과 비교한 오디오, 비전 벤치마크입니다(사고 노력 0.99 기준).
| 벤치마크 | Inkling-Small | Inkling | MiMo V2.5 | Qwen3-Omni | Qwen3.5 Omni-Plus | Gemini 3.5 Flash-Lite |
|---|---|---|---|---|---|---|
| MMMU Pro (Standard 10) | 74.0% | 73.5% | 75.4% | 60.0% | 71.0% | 79.0% |
| CharXiv RQ (원본 / Python 사용) | 77.4% / 81.3% | 78.1% / 82.0% | 81.0% / 미보고 | 61.1% / 미보고 | 72.5% / 미보고 | 70.0% / 미보고 |
| Audio MC | 54.9% | 56.6% | 30.4% | 24.3% | 37.6% | 33.6% |
| MMAU | 77.0% | 77.2% | 73.6% | 77.5% | 81.1% | 75.2% |
| VoiceBench | 90.1% | 91.4% | 86.4% | 88.8% | 92.4% | 85.9% |
주목할 지점은 Audio MC 입니다. 54.9%는 Xiaomi의 MiMo V2.5(30.4%), Qwen3-Omni(24.3%), Qwen3.5 Omni-Plus(37.6%), Gemini 3.5 Flash-Lite(33.6%)를 모두 크게 앞서는 수치로, 오디오를 전면에 내세운 옴니 모델들과 견줘도 격차가 뚜렷합니다. 형 모델(56.6%)에는 1.7pt 못 미치지만 활성 파라미터가 3분의 1이 채 안 된다는 점을 감안하면 손실이 작습니다.
물론 오디오 전 영역에서 앞서는 것은 아닙니다. MMAU와 VoiceBench에서는 Qwen3.5 Omni-Plus(81.1%, 92.4%)가 Inkling-Small(77.0%, 90.1%)보다 높습니다. 다만 VoiceBench는 규칙 기반 문자열 매칭으로 채점하므로 출력 형식 차이에 민감해, Thinking Machines Lab은 평가 시 답변 형식을 지시하는 시스템 메시지를 추가했다고 밝혔습니다.
에피스테믹스, 예측 벤치마크에서 프런티어 모델을 앞서다
Thinking Machines Lab은 캘리브레이션(calibration), 지시 따르기, 검열 저항을 묶어 에피스테믹스(Epistemics) 라고 부르며 별도로 학습시킵니다. Inkling-Small도 형과 동일한 방식으로, 실제 세계의 예측 질문을 모은 대규모 코퍼스에 대해 적정 점수 규칙(proper scoring rules) 을 상대로 강화 학습을 수행했습니다. 목적은 불확실한 상황에서 적절한 만큼의 확신을 표현하고, 잘 보정된 확률을 내놓게 하는 것입니다.
| 벤치마크 | Inkling-Small | Inkling | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro | Grok 4.3 |
|---|---|---|---|---|---|---|---|
| ForecastBench 검색 없음 (Brier Index ↑) | 61.3 ± 0.46 | 60.1 ± 0.54 | 58.8 ± 0.41 | 59.3 ± 0.33 | 56.2 ± 0.71 | 60.6 ± 0.43 | 60.9 ± 0.38 |
| ForecastBench 검색 사용 (Brier Index ↑) | 61.5 ± 0.54 | 61.0 ± 0.56 | 미보고 | 64.3 ± 0.79 | 59.9 ± 0.38 | 61.9 ± 0.69 | 61.3 ± 0.54 |
| Prophet Arena (Brier Score ↓) | 0.1238 ± 0.0086 | 0.1276 ± 0.0092 | 0.1265 ± 0.0093 | 0.1179 ± 0.0089 | 0.1181 ± 0.0087 | 0.1155 ± 0.0084 | 0.1264 ± 0.0089 |
검색을 쓰지 않는 ForecastBench 조건에서 Inkling-Small의 61.3은 표에 올라온 모든 모델 중 가장 높은 점 추정치입니다. 활성 12B의 오픈 웨이트 모델이 GPT-5.5(59.3), Claude Opus 4.8(56.2), Gemini 3.1 Pro(60.6), Grok 4.3(60.9)보다 위에 놓인 것인데, 이는 예측이 방대한 지식 암기보다 확률을 다루는 태도 에 더 의존하는 과제이고 그 태도가 명시적 학습으로 이식될 수 있음을 시사합니다. 다만 오차 범위(± 0.4~0.7)가 서로 겹치는 구간이라 원문 자신도 형과의 관계를 "예측에서 Inkling의 성능에 부합한다" 는 표현으로 조심스럽게 서술하므로, 순위표로 읽기보다 "이 체급에서 프런티어 모델과 같은 구간에 들어왔다" 정도로 읽는 편이 정확합니다.
검색을 붙이면 그림이 달라집니다. GPT-5.5(64.3)가 앞서 나가고, Prophet Arena Brier Score에서는 Gemini 3.1 Pro(0.1155)를 비롯한 클로즈드 프런티어 모델들이 더 낮은(더 좋은) 값을 기록합니다. 검색으로 최신 정보를 끌어와 통합하는 단계에서 지식 범위와 도구 사용의 차이가 드러나는 셈입니다. 이 결과는 2026년 7월 19일부터 28일 사이에 측정되었습니다.
남은 숙제, 지식 범위와 사실성
Thinking Machines Lab은 이 모델의 약점을 감추지 않습니다. 원문은 "Inkling이 지식 범위와 사실성에서 우위를 유지한다" 고 명시하며, 수치도 그 방향을 분명히 가리킵니다.
- SimpleQA Verified 20.6%: 형 모델 Inkling의 43.9%에 비해 절반 이하이고, 비슷한 크기의 DeepSeek V4 Flash(34.1%)나 Gemini 3.5 Flash-Lite(44.1%)에도 크게 밀립니다. 단답형 사실 질의에서 정확히 답하는 능력은 파라미터에 저장할 수 있는 지식의 총량과 직접 연결되므로, 총 파라미터가 975B에서 276B로 줄어든 대가가 가장 정직하게 드러나는 지표입니다.
- AA Omniscience 지수 -9.0: 정답에 가점을, 오답에 감점을 주어 지식의 폭과 환각 경향을 한 숫자로 묶은 지표입니다. Inkling은 +2.1, Gemini 3.5 Flash-Lite는 +6.9인데 Inkling-Small은 음수 구간에 머물러, 모르는 것을 답으로 내놓는 비중이 형보다 크다는 뜻이 됩니다.
- τ³-Banking 15.5%: 은행 도메인의 다중 턴 도구 사용 과제로, Inkling의 23.7%에 8.2pt 뒤집니다. 앞서 본 파레토 차트에서 토큰 효율은 가장 좋았지만 절대 점수는 뒤처진 바로 그 과제입니다. 정확한 도메인 지식과 긴 대화 유지가 함께 요구되는 시나리오에서는 작은 모델의 한계가 남아 있습니다.
이 약점은 곧 사용처를 가르는 기준이 됩니다. 코딩 에이전트, 도구 호출 워크플로우, 오디오 및 문서 이해처럼 필요한 지식을 컨텍스트로 넣어 주는 작업에서는 Inkling-Small이 비용 대비 강력한 선택입니다. 반면 모델의 내부 지식에 직접 의존하는 사실 질의응답에서는 검색 증강(RAG)이나 도구 연결을 전제로 설계해야 합니다. 100만 토큰 컨텍스트가 이 약점을 상당 부분 상쇄할 수 있는 장치이기도 합니다.
안전성과 남은 위험
Inkling-Small은 형과 동일한 안전 사후 학습 레시피를 물려받았고, 내부 평가와 신뢰할 수 있는 외부 파트너의 레드팀(red-teaming)을 포함한 동일한 배포 전 테스트를 거쳤습니다. 멀티모달 모델이므로 텍스트, 오디오, 이미지 입력 전반에서 안전 행동이 일관되게 유지되는지를 특히 살폈다고 밝히고 있습니다.
| 벤치마크 | Inkling-Small | Inkling | Nemotron 3 Ultra | Qwen3.5 397B-A17B | MiMo V2.5 | Minimax M2.7 | DeepSeek V4 Flash |
|---|---|---|---|---|---|---|---|
| FORTRESS (adversarial) | 71.6% | 78.0% | 77.6% | 77.3% | 64.8% | 86.3% | 32.0% |
| FORTRESS (benign) | 96.9% | 95.9% | 90.6% | 95.4% | 94.6% | 90.1% | 99.2% |
| StrongREJECT | 98.4% | 98.6% | 98.7% | 99.4% | 99.3% | 99.4% | 97.4% |
명백히 유해한 요청을 거부하는지 보는 StrongREJECT에서는 98.4%로 형과 사실상 동등하며 기존 오픈 웨이트 모델들과 나란합니다. 범죄, 폭력, 이중 용도(dual-use) 위험을 다루는 FORTRESS에서는 유해 요청 거부율 71.6%로 형(78.0%)보다 낮지만, 무해한 유사 질의에 여전히 답하는 비율(benign)은 96.9%로 형(95.9%)보다 높습니다. 과잉 거부를 덜 하는 쪽으로 균형점이 옮겨간 형태입니다.
CBRN과 사이버 영역에서는 안전장치를 제거한 변형(refusal-suppressed variant)까지 만들어 잠재 능력을 추정했고, 통제 상실(loss of control) 항목에서는 에이전틱 능력, 전략적 기만, 사보타주 가능성을 공개 프런티어 모델과 견줘 평가한 결과 프런티어 수준에 크게 못 미친다고 결론지었습니다. 종합적으로 "이미 공개된 오픈 웨이트 생태계에 존재하는 수준 이상의 위험을 초래하지 않는다" 는 판단입니다.
다만 잔여 위험으로 롤플레이나 간접적으로 표현된 프롬프트에 이따금 응하는 경향 이 남아 있다고 명시합니다. 이는 여느 오픈 웨이트 모델과 다르지 않으며, 모델의 거부에만 기대기보다 심층 방어(defense-in-depth)로 다루라는 것이 Thinking Machines Lab의 권고입니다. Llama Guard 같은 다운스트림 조정 도구가 Inkling-Small과 호환되므로, 특히 소비자 대상이나 트래픽이 많은 애플리케이션에서는 입출력 분류를 배포 스택의 일부로 두는 것이 좋습니다.
직접 실행하기, GPU 한 장까지 내려온 요구 사양
오픈 웨이트 모델에서 실질적으로 가장 중요한 변화는 여기입니다. Inkling과 Inkling-Small의 하드웨어 요구 사양을 나란히 놓으면 격차가 분명합니다.
| 체크포인트 | Inkling | Inkling-Small |
|---|---|---|
| BF16 최소 통합 VRAM | 2TB | 600GB |
| BF16 구성 | B300 8장 또는 H200 16장 | B300 4장 또는 H200 8장 |
| NVFP4 최소 통합 VRAM | 600GB | 180GB |
| NVFP4 구성 | B300 4장 (W4A4) 또는 H200 8장 (W4A16) | B300 1장 (W4A4) 또는 H200 2장 (W4A16) |
NVFP4 양자화(quantization) 체크포인트를 쓰면 NVIDIA B300 한 장 으로 276B 규모의 멀티모달 모델을 돌릴 수 있습니다. 다만 W4A4 모드는 SM100+ 아키텍처를 요구하므로, 그 조건을 만족하지 못하는 환경에서는 H200 2장에 W4A16으로 올리는 편이 현실적입니다.
추론 배포는 주요 오픈소스 프레임워크가 모두 지원하며, 각 프로젝트가 전용 레시피를 함께 공개했습니다.
- SGLang 레시피: Inkling-Small - SGLang Documentation
- vLLM 레시피: thinkingmachines/Inkling-Small | vLLM Recipes
- TokenSpeed 레시피: Model Recipes | TokenSpeed
- Unsloth 레시피: Inkling - How to Run Locally | Unsloth Documentation
- Hugging Face Transformers 레시피: Welcome Inkling by Thinking Machines
Tinker에서 파인튜닝하고 바로 써 보기
Inkling-Small은 Thinking Machines Lab의 파인튜닝 플랫폼 Tinker에서도 제공되며, 공개 시점 기준 기간 한정 할인이 적용됩니다. API 접근과 파인튜닝은 tinker-cookbook과 tml-renderers 패키지를 통해 이뤄지고, 요금 정보는 Tinker 모델 문서에서 확인할 수 있습니다.
uv pip install 'tinker-cookbook[inkling]'
inkling 엑스트라는 렌더링에 필요한 tml-renderers와 torch>=2.10을 함께 설치합니다. 이후 Cookbook이 모델 이름을 받는 자리에 아래처럼 지정하면 적절한 렌더러와 토크나이저가 자동으로 선택되며, :peft: 롱 컨텍스트 변형까지 동일하게 동작합니다.
model_name = "thinkingmachines/Inkling-Small"
Thinking Machines Lab이 Tinker를 앞세우는 논리는 "알맞게 파인튜닝된 모델이 여러 과제에서 클로즈드 모델을 더 빠르고 저렴하게 앞선다" 는 고객 경험입니다. Inkling-Small의 폭넓은 성능과 효율 조합은 실제 애플리케이션에서 실험하고 검증하기 쉬운 출발점이 됩니다.
학습에 들어가기 전에 모델을 먼저 만져 보고 싶다면 Tinker Playground에서 텍스트, 이미지, 오디오로 대화해 볼 수 있습니다. 이번 릴리스와 함께 Tinker의 다른 모델들과 사용자가 학습시킨 체크포인트도 모두 Playground에서 쓸 수 있게 되었고, 과금은 요금 페이지 기준으로 이뤄집니다.
라이선스
Inkling-Small은 Apache License 2.0으로 배포되고 있어, 연구 목적은 물론 상업적 용도로도 자유롭게 사용 및 수정이 가능합니다. 다만 Thinking Machines Lab은 별도의 Model Acceptable Use Policy와 학습 데이터 문서를 두고 있으므로, 배포 전에 함께 확인하시기 바랍니다.
Inkling-Small 소개 블로그
Inkling-Small 모델 카드
Inkling-Small 모델 (Hugging Face)
tinker-cookbook GitHub 저장소
Tinker Inkling 사용 문서
더 읽어보기
-
DeepSeek, 100만 토큰 컨텍스트를 효율적으로 지원하는 MoE 모델 DeepSeek-V4-Pro 및 DeepSeek-V4-Flash 공개
-
Qwen3.5: 초기부터 멀티모달 데이터로 학습한, 에이전트 중심의 워크플로우에 최적화된 Native Multimodal Agent Model
-
Xiaomi, 1.02T 파라미터 오픈소스 MoE 추론 모델 MiMo-v2.5 및 MiMo-v2.5-Pro 출시
-
OpenAI, GPT-5.6 Sol, Terra, Luna 프리뷰 공개: 새 네이밍 체계와 강화된 안전 스택
-
Artificial Analysis가 공개한 코딩 에이전트 벤치마크: 모델 + 하네스의 조합으로 평가한 벤치마크 결과
이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. ![]()
이 글이 유용하셨다면 아래
쪽 좋아요
를 눌러주세요 — 파이토치 한국 사용자 모임
이 새로운 소식을 정리하고 공유하는 데 힘이 됩니다! ![]()




