975B MoE 오픈 웨이트 모델 Inkling 파헤치기

프론티어급 언어모델은 대체로 API 뒤에 숨어 있다. 가중치를 받아 직접 파인튜닝하거나 자체 인프라에 올릴 수 있는 대형 모델은 흔치 않다. Thinking Machines Lab이 2026년 7월 15일 공개한 Inkling은 이 지점을 정면으로 겨눈다. 975B 파라미터 MoE 모델을 Apache 2.0으로 전체 가중치까지 공개했다.

아키텍처: 975B 중 41B만 깨운다

Inkling은 66층 디코더 트랜스포머에 희소 Mixture-of-Experts를 얹은 구조다. 전문가 256개 중 토큰마다 6개를 라우팅하고, 모든 토큰에 항상 관여하는 공유 전문가 2개를 더한다. 전체 파라미터는 975B지만 토큰 하나를 처리할 때 실제로 깨어나는 건 41B뿐이다. 여기에 로컬/글로벌 하이브리드 어텐션과 100만 토큰 컨텍스트 윈도우가 붙는다.

입력은 텍스트·이미지(40~4096px)·16kHz WAV 오디오(20분 이하)를 받고 출력은 텍스트다. 텍스트·이미지·오디오·비디오를 합쳐 45조 토큰으로 사전학습했고, BF16과 NVFP4 두 수치 형식을 지원한다.

한 분야에 몰빵하지 않는다

모델 카드가 스스로 강조하는 설계 방향은 "한 영역에 최적화하는 대신 넓게" 학습했다는 것이다. 그래서 벤치마크도 추론·비전·오디오·안전성에 고르게 걸쳐 있다.

카테고리 벤치마크 점수
추론(텍스트) HLE 29.7%
추론(수학) AIME 2026 97.1%
비전 MMMU Pro 73.3%
오디오 VoiceBench 91.4%
안전성 StrongREJECT 98.6%

Nemotron 3 Ultra, Kimi K2.5 같은 오픈 가중치 모델과 나란히 비교 평가됐다. AIME 점수가 유독 높은 반면 HLE는 30%를 밑도는데, 이 낙차 자체가 "넓게 학습한 제너럴리스트"라는 포지셔닝을 숫자로 보여준다.

배포와 파인튜닝 경로

로컬 서빙은 SGLang, vLLM, TokenSpeed, Unsloth, Hugging Face Transformers를 지원한다. vLLM이라면 다른 HF 모델과 같은 방식으로 띄울 수 있다.

vllm serve thinkingmachines/Inkling

직접 인프라를 두지 않으려면 Thinking Machines의 Tinker 플랫폼에서 파인튜닝과 추론을 함께 쓸 수 있고, 서드파티 추론 제공자 API도 열려 있다. 975B급을 감당하기 부담스럽다면 활성 파라미터 12B의 경량 변형 Inkling-Small도 함께 공개됐다. 같은 학습 레시피를 쓰면서 비용과 지연시간을 낮춘 선택지다.

안전성과 한계

일상 상호작용, CBRN·사이버 능력, 제어 상실 위험, 멀티모달 일관성까지 안전 평가를 거쳤다고 밝히면서도, 모델 카드는 "역할극이나 간접적 프롬프트에 대해서는 규정 준수 수준이 낮다"는 위험을 스스로 명시한다. 환각, 긴 멀티턴 대화에서의 성능 저하, 학습 데이터 편향도 남아 있는 한계다. 의료·법률처럼 안전이 중요한 결정에는 추가 검증을 요구하고, Llama Guard 같은 모니터링 도구를 함께 쓰는 인간 감독 체계를 권장한다.

가중치를 공개한다고 안전에 대한 책임이 사라지는 게 아니라, 그 책임이 이걸 파인튜닝해서 실제 서비스에 올리는 쪽으로 옮겨온다는 뜻이다. Inkling의 모델 카드가 안전성 섹션에 그만큼 공을 들인 이유도 여기에 있다.

댓글

아직 댓글이 없습니다.

댓글 남기기