Thinking Machines가 Inkling을 출시했습니다. 공식 확인된 바에 따르면, Thinking Machines Lab은 DeepSeek를 비롯한 최첨단 AI 시스템과 경쟁하기 위해 설계된 첫 오픈 웨이트 멀티모달 모델 Inkling을 발표했습니다. 이 회사는 폐쇄형 상용 API가 아닌 기업 맞춤화, 오픈 웨이트 배포, 그리고 개발자를 위한 운영 비용 절감에 초점을 맞추고 있습니다. Inkling은 Apache 2.0 라이선스로 배포되므로 기업 개발자는 독점적인 추론 API에 의존하지 않고도 모델을 배포, 수정 및 미세 조정할 수 있습니다.

Thinking Machines가 Inkling을 출시한 이유: 폐쇄형 소스 독점에 대한 도전
요약
- 전 OpenAI CTO Mira Murati의 스타트업인 Thinking Machines Lab이 오픈 웨이트 Apache 2.0 라이선스를 적용한 첫 자체 AI 모델 Inkling을 출시했습니다.
- 이 시스템은 총 9,750억 개의 파라미터(작업당 410억 개 활성)를 가진 MoE(Mixture-of-Experts) 트랜스포머 모델로, 45조 개의 텍스트, 이미지, 오디오, 비디오 토큰으로 학습되었습니다.
- 일반적인 폐쇄형 모델과 달리, Inkling은 기업이 자체적으로 미세 조정할 수 있는 시작점으로 설계되었으며, 사내 맞춤화 플랫폼인 Tinker를 활용합니다.
중앙 집중식 범용 모델과 맞춤형 도메인 특화 시스템 간의 구분은 거대한 진화를 거치고 있습니다. 지난 몇 년간 기업들은 독점 API와 자체 호스팅 오픈 웨이트 배포 방식 사이를 비교해 왔습니다. Inkling은 범용 호스팅 추론보다는 기업 맞춤화에 최적화된 Apache 2.0 모델을 제공함으로써 이 경쟁에 합류했습니다.
Inkling의 출시는 자체 호스팅 오픈 웨이트 모델과 기업 AI 맞춤화로 향하는 산업 전반의 흐름을 반영합니다. 기업이 민감한 비즈니스 기밀, 코드베이스, 재무 데이터를 독점 모델에 입력하면 해당 지식이 향후 모델의 공개 버전으로 흡수될 위험이 있습니다. 대규모 엔지니어링 그룹의 경우, Thinking Machines의 Inkling 출시는 핵심 소프트웨어 종속성을 다시 제어할 기회라고 할 수 있습니다. 자세한 내용은 Thinking Machines 공식 발표를 참고하십시오.

기술 아키텍처: Inkling과 DeepSeek 비교
프로토콜 계층에서 표준 밀집형 트랜스포머는 모든 토큰에 대해 전체 파라미터 세트를 활성화하므로 높은 컴퓨팅 비용과 지연 시간이 발생합니다. 이러한 컴퓨팅 병목 현상을 해결하기 위해, 새로 출시된 이 모델은 중국의 오픈 소스 선두 모델인 DeepSeek-V3와 유사한 MoE(Mixture-of-Experts) 설계를 채택했습니다. 각 MoE 계층은 256개의 라우팅 전문가와 2개의 공유 전문가로 구성되며, 토큰당 6개의 라우팅 전문가(약 410억 개의 활성 파라미터)만 실행됩니다. 이를 통해 시스템은 9,750억 개의 방대한 파라미터 지식 베이스를 유지하면서도 추론 비용과 지연 시간을 낮게 유지합니다.
어텐션 메커니즘의 경우, 이 시스템은 5:1 비율로 슬라이딩 윈도우와 글로벌 계층을 교차 배치하며 8개의 키-값(KV) 헤드를 활용합니다. Llama 및 DeepSeek와 같이 RoPE(Rotary Positional Embedding)에 의존하는 일반적인 아키텍처와 달리, 이 시스템은 상대적 위치 임베딩을 구현하여 최대 100만 토큰의 긴 컨텍스트 시퀀스에서 우수한 외삽 성능을 보여줍니다. DeepSeek-V3와 달리 Inkling은 MIT 라이선스가 아닌 Apache 2.0 라이선스로 공식 출시되었으며, Tinker를 통한 맞춤화 워크플로우를 강조하며 동일한 기업용 오픈 웨이트 시장을 공략합니다.
[표준 밀집형 모델 아키텍처] 입력 토큰 ──> 모든 파라미터 활성(975B) ──> 높은 컴퓨팅 비용 및 지연 시간 [MoE(Mixture-of-Experts) 아키텍처] 입력 토큰 ──> Sigmoid 기반 라우터 ──> 활성 전문가(41B) ──> 저비용, 빠른 추론
많은 대규모 MoE 배포 사례에서 추론 효율성은 산술 처리량보다 메모리 대역폭에 의존하는 경향이 커지고 있으며, 이에 따라 많은 환경이 메모리 중심의 추론 최적화로 전환하고 있습니다. 기본 모델은 처음부터 사전 학습되었지만, 사후 학습 단계에서는 Moonshot AI의 Kimi K2.5를 포함한 기존 오픈 웨이트 모델이 생성한 합성 데이터 부트스트랩을 활용했습니다. 벤치마크 결과에 따르면, Inkling은 더 적은 토큰만 사용하고도 NVIDIA Nemotron 3 Ultra와 대등한 성능을 달성합니다. Thinking Machines의 Inkling 출시와 함께 검증된 구조적 기능은 맞춤형 MoE 아키텍처가 전반적인 운영 오버헤드를 얼마나 효과적으로 줄일 수 있는지 보여줍니다. 자세한 내용은 Thinking Machines Interaction Models 보고서를 참조하십시오.
Inkling vs. DeepSeek-V3 한눈에 보기
선도적인 오픈 웨이트 아키텍처 간의 기술적 차이를 설명하기 위해, 다음 비교표는 핵심 설계 선택 사항을 요약합니다:
| 기술 지표 | Inkling MoE 모델 | DeepSeek-V3 아키텍처 |
|---|---|---|
| 오픈 소스 라이선스 | Apache 2.0 (허용적) | MIT (허용적) |
| 총 파라미터 규모 | 9,750억 개의 총 파라미터 | 6,710억 개의 총 파라미터 |
| 활성 파라미터 | 토큰당 410억 개 활성 | 토큰당 370억 개 활성 |
| 컨텍스트 윈도우 크기 | 최대 100만 토큰 | 최대 12만 8천 토큰 |
| 위치 임베딩 | 상대적 위치 임베딩 | 회전 위치 임베딩(RoPE) |

구축 vs. 구매: 오픈 웨이트 배포 전략
범용 AI API 유지 관리를 위한 운영 비용이 계속 증가함에 따라, Inkling의 출시는 엔지니어링 팀이 장기적인 인프라 전략을 재평가하도록 유도합니다. 시스템 종속성을 재평가하면 중요한 재무적 현실이 드러납니다. 독점 모델을 빌려 쓰는 것은 이중 지불의 덫에 빠질 수 있습니다. Satya Nadella는 최근 독점 AI를 사용하는 기업이 실질적으로 비용을 두 번 지불하고 있다고 주장했습니다. 한 번은 직접적인 구독 비용으로, 또 한 번은 프롬프트에 포함된 기업 고유의 비즈니스 지식을 제공함으로써 지불합니다. 이에 대한 논의는 Nadella 기술 자문 게시물에서 확인할 수 있습니다.
추론 비용의 절감은 기업이 인프라 지출을 평가하는 방식도 변화시킵니다. FinOps 관점에서 맞춤형 로컬 파이프라인을 구축할지, 독점 클라우드 엔드포인트를 계속 구독할지 평가하려면 컴퓨팅 효율성에 대한 엄격한 분석이 필요합니다. Thinking Machines의 Inkling 출시로 개발자는 토큰 예산과 성능 프로필 간의 균형을 더 쉽게 맞출 수 있게 되었습니다. 모델 가중치가 공개되어 있어 조직은 독점 플랫폼에 종속되지 않고 배포 파이프라인을 맞춤화하고 상업적으로 배포할 수 있습니다. 이러한 맞춤화 패러다임은 Thinking Machines Lab의 미세 조정 플랫폼인 Tinker에 의해 완벽하게 지원되며, 이곳에서 조직은 비공개 가중치를 업로드하고 도메인별 타겟 학습을 실행할 수 있습니다.
배포 시나리오 및 플랫폼 선택
변화하는 경제 모델 하에서 인프라 설계자가 호스팅 구성을 평가할 수 있도록 다음 배포 매트릭스는 표준적인 절충안을 제시합니다:
| 배포 시나리오 | 추론 비용 | 맞춤화 지원 | 데이터 주권 |
|---|---|---|---|
| 호스팅형 폐쇄 소스 API | 높음 (토큰당 과금) | 없음 (고정 시스템 기본값) | 낮음 (외부 API 라우팅) |
| 자체 호스팅 기본 Inkling | 중간 (서버 인프라) | 중간 (수동 로컬 업데이트) | 높음 (로컬 우선 호스팅) |
| Tinker 기반 미세 조정 Inkling | 낮음 (작업별 최적화된 런타임) | 높음 (프로그래밍 방식 미세 조정) | 높음 (프라이빗 클라우드 격리) |
오픈 웨이트 맞춤화 방식의 가치는 세계 최대 헤지펀드인 Bridgewater Associates와 Thinking Machines의 공동 프로젝트를 통해 입증되었습니다. 기본적인 오픈 모델을 활용하여 Bridgewater의 금융 전문 지식을 추가로 학습시킨 결과, 금융 추론 테스트에서 84.7%의 점수를 기록한 시스템을 구축했습니다. 이 맞춤형 모델은 기존 독점적 대안들보다 뛰어난 성능을 보였으며, 운영 비용은 1/14 수준에 불과했습니다. 이러한 성능 지표는 FinOps 목표를 직접적으로 뒷받침하며, 개발자가 토큰 예산과 성능 프로필 간의 균형을 맞출 수 있게 해줍니다. 자세한 내용은 Bridgewater 금융 추론 연구를 확인하십시오.

통합 체크리스트: 엔지니어링 팀을 위한 플랫폼 변화 대비법
오픈 웨이트 모델이 업계 표준으로 자리 잡음에 따라 데이터 파이프라인을 보호하고 기술적 자율성을 확보하려면 엔지니어링 및 제품 팀은 명확한 전환 로드맵을 수립해야 합니다.
개발자 구현 체크리스트
- 추론 파이프라인 평가: SGLang, vLLM, llama.cpp와 같은 프레임워크를 사용하여 양자화 벤치마크를 설정하고 메모리 점유율을 최적화하십시오.
- GPU 활용률 벤치마킹: 동시 추론 실행 중 메모리 대역폭 제약을 최소화하기 위해 활성 전문가 라우팅 경로를 분석하십시오.
- 미세 조정 워크플로우 감사: Tinker와 같은 플랫폼에서 모델 맞춤화 템플릿을 구성하여 평가 기준을 자동화하십시오.
제품 및 성장 전략 체크리스트
- 모델 라이선스 매개변수 확인: Apache 2.0 약관을 검토하여 향후 상업적 재배포를 위한 규정 준수 여부를 확인하십시오.
- FinOps 모니터링 구축: 자체 호스팅 오픈 웨이트의 장기 서버 호스팅 비용을 종량제 클라우드 API 구독 비용과 비교하여 컴퓨팅 파이프라인을 최적화하십시오.
- 독점 데이터 저장소 격리: 민감한 기업 지식이 외부 공개 모델에 수집되지 않도록 엄격한 데이터 샌드박스를 구축하십시오.
이러한 구조적 지침을 마련함으로써 개발 팀은 운영 연속성을 유지하면서 더욱 안전하고 규정을 준수하는 아키텍처로 전환할 수 있습니다.
자주 묻는 질문(FAQ)
폐쇄형 독점 모델을 사용하면 기업이 왜 "비용을 두 번 지불"하게 되나요?
Inkling의 Mixture-of-Experts(MoE) 아키텍처가 가진 기술적 장점은 무엇인가요?
Inkling은 중앙 집중식 가드레일 없이도 기업 환경에서 안전하게 배포할 수 있나요?
Inkling은 오픈 소스인가요?
엔지니어링 팀을 위한 핵심 요약
Inkling은 기업용 AI가 맞춤형 오픈 웨이트 배포 방향으로 나아가고 있음을 보여줍니다. Inkling은 독점 AI 플랫폼을 완전히 대체하기보다는 엔지니어링 팀이 선택할 수 있는 배포 전략의 범위를 넓혀줍니다.
오픈 웨이트 모델을 도입하는 조직은 독점 API에 대한 의존보다는 프라이빗 배포, 모델 거버넌스, 효율적인 추론, 그리고 장기적인 운영 효율성을 우선시하게 될 것입니다. 따라서 팀은 효율적인 미세 조정, 추론 최적화 및 거버넌스가 가능한 인프라를 우선적으로 고려해야 합니다.
Share this article



