SkillOpt, 모델 가중치 그대로 agent 점수 23.5점 끌어올린 skill 학습법
agent 성능 개선이 항상 새 모델이나 fine-tuning을 뜻하지는 않는다. Microsoft Research의 SkillOpt는 GPT-5.5 direct chat 6개 benchmark 평균을 58.8에서 82.3으로 올렸고, 52개 평가 셀에서 최고 또는 공동 최고를 기록했다.
카테고리
Insights의 LLM 기사
agent 성능 개선이 항상 새 모델이나 fine-tuning을 뜻하지는 않는다. Microsoft Research의 SkillOpt는 GPT-5.5 direct chat 6개 benchmark 평균을 58.8에서 82.3으로 올렸고, 52개 평가 셀에서 최고 또는 공동 최고를 기록했다.
Copilot 모델 선택지가 처음으로 open-weight 모델까지 넓어졌다. GitHub는 Kimi K2.7 Code를 VS Code부터 순차 제공하고, Business와 Enterprise는 관리자가 정책으로 켜야 한다고 설명했다.
1.6T total, 48B active라는 숫자보다 인프라가 논점이다. HN 댓글은 모델 구조보다 국산 AI ASIC cluster 훈련을 더 큰 신호로 봤다.
점수보다 논점이 더 흥미롭다. HN 댓글은 새 benchmark 자체보다 “시니어 엔지니어”를 어떻게 재현할 수 있느냐에 모였다.
LLM 추론 속도를 높이는 다른 경로가 등장했다. NVIDIA의 Nemotron-Labs-TwoTower는 30B 백본을 두 타워 확산 모델로 바꿔 98.7% 품질과 2.42배 처리량을 동시에 제시했다.
낮은 가격대의 Sonnet 모델이 agent 작업에서 Opus 4.8에 가까운 구간까지 올라섰다. Free·Pro 기본 모델과 API, Claude Code에 동시에 들어오며, 8월 31일까지 입력 100만 토큰당 $2·출력 100만 토큰당 $10의 도입 가격이 적용된다.
벤치마크 숫자보다 HN 댓글이 파고든 지점은 작은 모델을 실제 코딩 루프에 넣었을 때의 속도와 안정성이다.
숨은 Unicode marker 자체보다 개발자 도구가 이를 설명 없이 system context에 넣는 방식이 논점이다.
무료 리더보드로 알려진 Arena가 상용 서비스 출시 8개월 만에 연환산 매출 $100M에 도달했다. 1,000만 건 넘는 사용자 평가가 모델 랩과 기업의 post-training 예산으로 바뀌는 흐름이다.
LocalLLaMA의 관심은 “큰 모델”보다 6B active MoE가 실제로 얼마나 local에 가까운가에 모였다.
privacy와 비용을 잡으려는 개발자들이 Qwen 3.6 27B의 “충분히 쓸 만한” 지점을 파고들었다.
오픈 weight 모델이 실제 보안 버그 탐지 과제에서 Claude Code를 앞섰다는 점에 관심이 모였다.