SkillOpt, 모델 가중치 그대로 agent 점수 23.5점 끌어올린 skill 학습법
agent 성능 개선이 항상 새 모델이나 fine-tuning을 뜻하지는 않는다. Microsoft Research의 SkillOpt는 GPT-5.5 direct chat 6개 benchmark 평균을 58.8에서 82.3으로 올렸고, 52개 평가 셀에서 최고 또는 공동 최고를 기록했다.
태그
#benchmarks 태그가 달린 기사
agent 성능 개선이 항상 새 모델이나 fine-tuning을 뜻하지는 않는다. Microsoft Research의 SkillOpt는 GPT-5.5 direct chat 6개 benchmark 평균을 58.8에서 82.3으로 올렸고, 52개 평가 셀에서 최고 또는 공동 최고를 기록했다.
생물학용 AI 에이전트 평가는 단순 Q&A에서 실제 연구 판단 재현으로 이동하고 있다. OpenAI의 GeneBench-Pro는 129개 계산생물학 문제를 제시하며, GPT-5.6 Sol도 최고 추론 설정에서 28.7%, Pro mode에서 31.5%에 그쳤다.
벤치마크 숫자보다 HN 댓글이 파고든 지점은 작은 모델을 실제 코딩 루프에 넣었을 때의 속도와 안정성이다.
무료 리더보드로 알려진 Arena가 상용 서비스 출시 8개월 만에 연환산 매출 $100M에 도달했다. 1,000만 건 넘는 사용자 평가가 모델 랩과 기업의 post-training 예산으로 바뀌는 흐름이다.
OpenRouter가 오픈웨이트 모델에 GPQA와 TAU-Bench를 지속 실행하고, 그 결과를 AutoExacto 라우팅에 반영한다고 설명했다. GLM 5.2 페이지에서는 1M 토큰 컨텍스트와 $0.94/$3 per 1M 가격 같은 실사용 지표도 함께 노출된다.
GitHub이 Copilot agentic harness를 SWE-bench Verified, SWE-bench Pro, SkillsBench, TerminalBench, Win-Hill에서 비교했다. 같은 모델·같은 과제 조건에서 해결률은 모델 기본 하네스와 비슷했고, 대부분의 구성에서 토큰 사용량은 더 낮았다는 점이 핵심이다.
오픈웨이트 모델 경쟁이 가격 실험을 넘어 실제 에이전트 배치 문제로 이동했다. OpenRouter는 DeepSeek V4 Flash, GLM 5.2, MiniMax M3, Nemotron 3 Ultra 등 4개 모델을 June 2026 핵심 후보로 제시하며 SWE-bench 79.0%, 1M context, 최대 150x 비용 차이를 근거로 들었다.
OpenRouter는 6월 오픈 weight 모델 흐름을 DeepSeek V4 Flash, GLM 5.2, MiniMax M3, NVIDIA Nemotron 3 Ultra 네 축으로 정리했다. 핵심 숫자는 SWE-bench Verified 79.0%, Intelligence Index 51, 1M context, 그리고 frontier API 대비 큰 가격 차이다.
모델 선택이 정적 리더보드에서 실행 중 라우팅 문제로 바뀌고 있다. OpenRouter는 Benchmarks API로 Artificial Analysis와 Design Arena 등 실시간 점수를 에이전트가 조회할 수 있게 했고, GLM-5.2가 코딩과 디자인 모두에서 최상위라고 적었다.
오픈 weights 모델 경쟁의 논점이 단순 점수에서 비용, reasoning token, 실제 agent 작업 효율로 옮겨갔다.
OpenRouter가 여러 모델의 답을 병렬 합성하는 Fusion API를 공개하며 DRACO 100개 연구 과제에서 Fable 5에 1% 이내로 접근했다고 밝혔다. 핵심은 최고가 단일 모델이 아니라 예산 모델 패널과 판정 모델을 조합해 비용을 약 절반으로 낮춘 점이다.
r/MachineLearning의 관심은 “코드가 없는 SOTA”를 leaderboard에 어떻게 넣을지라는 현실적인 문제에 모였다.