Inkling-Small NVFP4, Hugging Face에 오른 공개 가중치 멀티모달 모델
Original: Inkling-Small NVFP4 reaches Hugging Face as open-weight multimodal model View original →
공개 가중치 모델의 배포 신호
멀티모달 모델 경쟁에서 중요한 변화는 대형 연구소의 데모뿐 아니라 실제로 내려받아 미세조정할 수 있는 체크포인트가 늘어나는 것이다. NVIDIA AI는 2026년 7월 30일 Thinking Machines의 Inkling-Small NVFP4를 소개하며 Another open-weight release from @thinkymachines. Inkling-Small is here. With native reasoning over audio and images and variable thinking effort, it is a great choice for fine-tuning, with NVIDIA NeMo on NVIDIA DGX Station.라고 적었다. 원문 트윗은 여기에 있다.
연결된 Hugging Face 페이지는 모델의 성격을 더 구체적으로 보여준다. thinkingmachines/Inkling-Small-NVFP4는 thinkingmachines/Inkling-Small의 quantized 버전으로 표시되며, license는 Apache-2.0이다. 태그에는 transformers, safetensors, image-text-to-text, audio-text-to-text, conversational, MoE가 포함된다. Hugging Face API 기준으로 NVFP4 체크포인트는 2026년 7월 27일 생성됐고 7월 30일 수정됐으며, 조회 시점에 다운로드 수가 25,000회를 넘었다.
NVIDIA AI 계정은 GPU, NeMo, DGX, 추론·학습 스택과 연결되는 모델 소식을 자주 전달한다. 그래서 이 트윗의 맥락은 단순 추천보다 실용 쪽에 가깝다. NVIDIA는 Inkling-Small을 NeMo와 DGX Station에서 미세조정하기 좋은 모델로 제시했다. NVFP4는 더 낮은 정밀도의 체크포인트를 통해 배포와 실험 비용을 낮추려는 흐름과 맞닿아 있다.
다음에 볼 것은 독립 평가와 실제 미세조정 결과다. 공개 가중치, Apache-2.0, 이미지·오디오 태그만으로는 모델의 품질이나 안전성을 판단할 수 없다. 개발자는 원본 Inkling-Small과 NVFP4 버전의 성능 차이, 도구 호출이나 긴 대화에서의 안정성, 상업적 서비스에 넣을 때 필요한 평가 절차를 확인해야 한다.
Related Articles
HN의 관심은 benchmark 1등보다 조합에 모였다. Thinking Machines Lab의 Inkling은 multimodal MoE, 조절 가능한 reasoning effort, Tinker fine-tuning을 한 묶음으로 내세우며 open-weight 모델의 쓰임새를 다시 묻는다.
멀티모달 추론 모델의 공개 경쟁이 한 단계 더 치열해졌다. Thinking Machines는 Inkling 전체 가중치를 공개하고, 64K와 256K 컨텍스트 옵션 및 Tinker fine-tuning 경로를 함께 열었다.
대형 모델 서빙의 병목이 가중치 이동으로 좁혀졌다. NVIDIA는 ModelExpress로 DeepSeek-V4 Pro 시작 시간을 8분에서 1분 44초 수준으로 줄였다고 밝혔다.