LLM X/Twitter
Kimi K3, DeepSWE에서 Fable 5 대비 달러당 해결 작업 2.8배
코딩 에이전트 평가는 이제 pass@1만으로 부족하다. Together AI는 DeepSWE 분석에서 Kimi K3가 Fable 5에 근접한 pass@1을 보이면서 rollout 비용은 약 3분의 1이었다고 밝혔다.
1분 소요 19 조회
태그
#kimi-k3 태그가 달린 기사
코딩 에이전트 평가는 이제 pass@1만으로 부족하다. Together AI는 DeepSWE 분석에서 Kimi K3가 Fable 5에 근접한 pass@1을 보이면서 rollout 비용은 약 3분의 1이었다고 밝혔다.
공개 모델용 코딩 에이전트가 특정 모델 하네스와 SDK 호환성을 앞세워 성숙하고 있다. OpenInterpreter는 Rust로 구현한 Kimi K3 네이티브 하네스, Apache 라이선스, ACP와 Codex SDK 호환을 내세웠다.
보안 코드 분석에서 최고 성능과 반복 비용의 간극이 커지고 있다. Malte Ubl은 비공개 Deepsec 평가에서 GPT-5.6 Sol이 최고 재현율·정밀도를 보였지만 실행 비용은 차점 모델의 7배 이상이라고 밝혔다.
2.8조 파라미터와 100만 토큰 context를 앞세운 Kimi K3가 HN 논쟁의 중심에 섰다. 관심은 benchmark 숫자보다 open model이 proprietary frontier와 얼마나 가까워졌는지에 모인다.
2.8T 파라미터와 1M-token context를 내건 Kimi K3가 공개되며 open-weight 모델의 규모 경쟁이 다시 커졌다. 전체 가중치는 2026년 7월 27일까지 공개될 예정이고, 현재는 Kimi.com·Kimi Code·API에서 사용할 수 있다.