본문으로 건너뛰기

태그

#coding-agents

#coding-agents 태그가 달린 기사

RSS 피드
AI X/Twitter

Claude Opus 4.7, CursorBench 70%로 4.6의 58%를 넘기고 Opus 가격 유지

중요한 점은 Anthropic이 Opus를 더 긴 자율 코딩 작업에 맞추면서도 가격을 올리지 않았다는 데 있다. 연결된 페이지는 Opus 4.7이 CursorBench에서 70%를 기록해 Opus 4.6의 58%를 넘겼고, API 가격은 입력 100만 토큰당 5달러와 출력 100만 토큰당 25달러로 유지된다고 적었다.

2분 소요 40 조회
LLM 해커뉴스

Qwen3.6-35B-A3B, HN이 주목한 건 3B active MoE의 코딩 성능이었다

HN이 먼저 본 포인트는 open weights였다. 35B MoE지만 active parameter가 3B인 모델이 실제 coding agent 일을 버틸 수 있느냐가 핵심이었다. Qwen은 Qwen3.5-35B-A3B 대비 큰 개선을 내세웠고, 댓글은 곧바로 GGUF 변환, Mac 메모리 한계, open model끼리만 비교한 benchmark 해석으로 옮겨갔다.

1분 소요 51 조회
LLM

LiteCoder, Terminal Bench Pro 31.5%로 코드 agent를 끌어올렸다

LiteCoder가 terminal 특화 모델만 내놓은 것이 아니라 11,255개 trajectory와 602개 Harbor 환경까지 함께 풀었다. 30B 모델은 Terminal Bench Pro에서 Pass@1 31.5%를 기록해 preview의 22.0%에서 크게 올라왔고, 작은 코드 agent도 아직 더 밀어 올릴 여지가 있다는 주장을 숫자로 뒷받침한다.

2분 소요 41 조회
LLM

Google, Docs MCP와 Developer Skills로 Gemini coding agents 최신성 유지

Google은 coding agents가 model training data cutoff 때문에 오래된 Gemini API 코드를 생성할 수 있다고 보고, 이를 해결하는 수단으로 Docs MCP와 Developer Skills를 함께 제시했다. 두 도구를 같이 쓰면 eval set에서 vanilla prompting 대비 96.3% pass rate와 63% fewer tokens per correct answer를 기록했다고 회사는 밝혔다.

1분 소요 45 조회
LLM 해커뉴스

논문과 경쟁 코드를 먼저 읽는 에이전트, Hacker News가 본 실전 성능 개선

Hacker News에서 주목한 SkyPilot 글은 coding agent가 코드를 건드리기 전에 논문과 경쟁 구현을 읽도록 하면 llama.cpp CPU inference 최적화 품질이 실제로 올라간다고 주장했다. 4대의 cloud VM과 약 29달러 비용으로 TinyLlama 1.1B 기준 x86 text generation을 15%, ARM을 5% 끌어올렸다는 점이 핵심이다.

2분 소요 36 조회
LLM 해커뉴스

Hacker News, coding agent를 구성하는 여섯 가지 핵심 블록 정리

Sebastian Raschka가 2026년 4월 4일 공개한 글은 coding agent의 성능 차이가 단순히 base model보다 harness 설계에서 나온다고 주장한다. 그는 live repo context, prompt/cache reuse, structured tools, context reduction, session memory, bounded subagents를 여섯 가지 핵심 구성요소로 정리했고, Hacker News에서는 이를 Codex·Claude Code류 도구를 이해하는 실무적 기준으로 받아들였다.

2분 소요 42 조회