Qwen 2.5 → 3 → 3.5 세대별 최소 모델 비교: 압도적 성능 향상
r/LocalLLaMA에서 Qwen 세대별 최소 모델을 비교한 결과가 681점을 획득하며 화제가 됐습니다. Qwen 3.5의 9B 모델이 이전 세대 80B 모델을 여러 벤치마크에서 능가하고, 2B 모델이 7B급 성능을 보이는 등 세대별 개선이 놀라운 수준입니다.
카테고리
Insights의 LLM 기사
r/LocalLLaMA에서 Qwen 세대별 최소 모델을 비교한 결과가 681점을 획득하며 화제가 됐습니다. Qwen 3.5의 9B 모델이 이전 세대 80B 모델을 여러 벤치마크에서 능가하고, 2B 모델이 7B급 성능을 보이는 등 세대별 개선이 놀라운 수준입니다.
중국 AI 연구소 DeepSeek이 텍스트·이미지·동영상·오디오를 처리하는 1조 매개변수 멀티모달 모델 V4를 이번 주 공개할 예정이며, 화웨이 칩에 최적화돼 미국 GPU 의존도를 낮춘 점이 주목된다.
앤트로픽이 Claude를 Microsoft Excel, PowerPoint, Gmail, Google Drive 등 주요 업무 도구에 직접 내장하는 Claude Cowork 엔터프라이즈 플러그인을 발표했다.
100개 미만의 파라미터를 가진 초소형 트랜스포머 모델이 두 개의 10자리 숫자를 더하는 작업에서 100% 정확도를 달성했다는 흥미로운 연구 결과가 공개되었습니다.
AI 스타트업 Inception Labs가 확산(diffusion) 기반 언어 모델 Mercury 2를 공개했다. 기존 자기회귀 방식을 탈피해 병렬 정제 방식을 사용하며, 속도와 비용 양면에서 주요 경쟁사를 압도한다.
커뮤니티 개발자가 2x RTX 3090(NVLink) 환경에서 vLLM과 텐서 병렬화를 활용해 Qwen3.5 27B 모델을 170k 컨텍스트에서 초당 100+ 토큰 디코딩, 최대 585t/s의 멀티 요청 처리 성능을 달성했다.
오픈소스 도구 llmfit이 Hacker News에서 주목을 받고 있다. 사용자의 RAM, CPU, GPU 사양을 분석해 최적의 LLM 모델을 자동으로 선택하고 구성해주는 유틸리티로, 로컬 LLM 실행의 진입 장벽을 크게 낮춘다.
Anthropic이 트럼프 행정부의 금지 조치를 받은 이후 Claude 앱이 미국 앱스토어 무료 앱 1위에 올랐다. 일일 신규 가입자 수가 역대 최고치를 기록하며, 한 달 만에 무료 사용자가 60% 이상 증가했다.
DeepSeek R1 모멘트 이후 13개월 동안 로컬 AI 실행 환경이 얼마나 빠르게 발전했는지를 보여주는 놀라운 비교: $6,000짜리 서버에서 겨우 5 TPS로 실행되던 프론티어 모델이, 이제 $600 미니 PC에서 같은 속도로 훨씬 강력한 모델을 실행할 수 있다.
Mac Mini M4를 보유한 개발자가 Claude의 도움을 받아 Apple의 비공개 Neural Engine(ANE) API를 역설계하고, 이를 활용해 110M 파라미터 Microgpt 모델을 훈련시키는 데 성공했다.
Alibaba의 Qwen 팀이 Qwen 3.5 Small 모델을 출시했다. r/LocalLLaMA에서 1,000점 이상을 기록한 이 발표는 고성능 소형 모델에 대한 커뮤니티의 높은 관심을 반영한다.
Claude가 XML 태그를 특별하게 처리하는 이유를 분석한다. Anthropic의 훈련 과정에서 XML 구조가 광범위하게 사용되었으며, 이것이 Claude 프롬프트 엔지니어링에서 XML 태그가 가장 효과적인 구분자가 되는 이유다.