Shieldstral, 3B 멀티모달 안전 모델을 단일 16GB GPU로 가져온 공개 가중치 전략
Original: Shieldstral puts a 3B multimodal safety model on one GPU View original →
작은 안전 모델의 실전 배치 조건
콘텐츠 안전 분류가 대형 폐쇄형 API에만 묶일 필요가 줄어들고 있다. Mistral AI는 X에서 Shieldstral을 공개하며 “3B open-weights model for content safety”라고 요약했다. 원문은 Mistral AI의 트윗이며, 이 모델은 텍스트와 이미지 입력을 같은 방식으로 다루는 멀티모달 안전 분류기를 목표로 한다.
“3B open-weights model for content safety”
Hugging Face 모델 카드와 Mistral 문서에 따르면 Shieldstral 1.0은 자연어로 쓴 안전 정책을 입력으로 받아 문서가 그 기준을 만족하는지 yes/no 형태로 판단한다. 고정된 moderation 카테고리만 예측하는 방식과 달리, 운영팀이 정책 문장을 바꾸면 재학습 없이 다른 기준으로 분류할 수 있다. 모델 카드는 12개 언어, 32k 토큰 학습 범위, Apache 2.0 라이선스, Safetensors 가중치를 명시한다.
수치도 배치 관점에서 중요하다. Mistral은 Shieldstral을 3B급 모델로 소개했고, 문서의 공개 프리뷰 표는 파라미터를 3.8B로 적는다. 모델 카드는 WildGuardTest prompt safety F1 88.1, HarmBench prompt classification F1 99.4, VLGuard multimodal safety F1 97.7을 제시한다. 대형 safety 모델을 원격 호출하지 않고, 단일 GPU 환경에서 정책 적응형 필터를 돌리고 싶은 팀에는 이 지점이 핵심이다.
다음에 볼 지점
Mistral 계정은 오픈 가중치 모델, API 제품, 연구 결과를 빠르게 알리는 공식 채널이다. 이번 트윗의 후속 관찰 지점은 실제 운영에서 임계값 조정이 얼마나 안정적인지, 한국어·일본어를 포함한 다국어 moderation에서 모델 카드의 수치가 재현되는지, 그리고 vLLM·llama.cpp 같은 배포 경로가 얼마나 빨리 성숙하는지다.
Source: Mistral AI on X
Related Articles
2.4T MoE 모델이 공개 가중치까지 예고하면서 폐쇄형 코딩 모델의 가격 기준이 압박받는다. Qwen은 Qwen3.8-Max 입력 $2, 출력 $6/M 토큰과 1M 컨텍스트를 함께 제시했다.
2026년 3월 16일 r/LocalLLaMA의 Mistral Small 4 글은 최신 사용 가능 크롤 기준 606 points와 232 comments를 기록했다. Mistral 모델 카드는 4 active expert, 256k context, 멀티모달 입력, 요청별 reasoning 전환을 갖춘 119B급 MoE를 설명한다.
HN의 관심은 benchmark 1등보다 조합에 모였다. Thinking Machines Lab의 Inkling은 multimodal MoE, 조절 가능한 reasoning effort, Tinker fine-tuning을 한 묶음으로 내세우며 open-weight 모델의 쓰임새를 다시 묻는다.