M5 Max에서 돈 Qwen3.6, LocalLLaMA의 관심은 code를 밖으로 안 보내도 되나였다
r/LocalLLaMA가 이 글을 끌어올린 이유는 “trust me bro”식 후기 안에 8-bit, 64k context, OpenCode, Android debugging이라는 실제 사용 조건이 들어 있었기 때문이다.
태그
#coding-agents 태그가 달린 기사
r/LocalLLaMA가 이 글을 끌어올린 이유는 “trust me bro”식 후기 안에 8-bit, 64k context, OpenCode, Android debugging이라는 실제 사용 조건이 들어 있었기 때문이다.
r/LocalLLaMA가 이 글에 반응한 이유는 leaderboard 숫자보다, Opus 4.7의 체감 악화와 Kimi K2.6의 실제 coding agent 운용 가능성이 충돌했기 때문이다.
Factory는 $150M Series C로 valuation을 $1.5B까지 끌어올렸다. 핵심은 coding agents가 개인용 assistant가 아니라 model routing, governance, cost control을 포함한 enterprise software factory로 팔리고 있다는 점이다.
중요한 점은 Anthropic이 Opus를 더 긴 자율 코딩 작업에 맞추면서도 가격을 올리지 않았다는 데 있다. 연결된 페이지는 Opus 4.7이 CursorBench에서 70%를 기록해 Opus 4.6의 58%를 넘겼고, API 가격은 입력 100만 토큰당 5달러와 출력 100만 토큰당 25달러로 유지된다고 적었다.
Cursor는 better coding model이 developer work의 형태를 바꾼다는 주장을 usage data로 뒷받침했다. 500-team study에서 high-complexity tasks는 68% 늘었고, documentation은 62%, UI/styling은 15% 증가했다.
HN이 먼저 본 포인트는 open weights였다. 35B MoE지만 active parameter가 3B인 모델이 실제 coding agent 일을 버틸 수 있느냐가 핵심이었다. Qwen은 Qwen3.5-35B-A3B 대비 큰 개선을 내세웠고, 댓글은 곧바로 GGUF 변환, Mac 메모리 한계, open model끼리만 비교한 benchmark 해석으로 옮겨갔다.
LiteCoder가 terminal 특화 모델만 내놓은 것이 아니라 11,255개 trajectory와 602개 Harbor 환경까지 함께 풀었다. 30B 모델은 Terminal Bench Pro에서 Pass@1 31.5%를 기록해 preview의 22.0%에서 크게 올라왔고, 작은 코드 agent도 아직 더 밀어 올릴 여지가 있다는 주장을 숫자로 뒷받침한다.
GitHub는 Copilot cloud agent를 GitHub Mobile에서 pull request review를 넘는 workflow로 확장했다. 이제 개발자는 휴대폰에서 codebase research, implementation plan 작성, branch 수정, diff review, pull request 생성까지 이어서 지시할 수 있다.
Google은 coding agents가 model training data cutoff 때문에 오래된 Gemini API 코드를 생성할 수 있다고 보고, 이를 해결하는 수단으로 Docs MCP와 Developer Skills를 함께 제시했다. 두 도구를 같이 쓰면 eval set에서 vanilla prompting 대비 96.3% pass rate와 63% fewer tokens per correct answer를 기록했다고 회사는 밝혔다.
Hacker News에서 주목한 SkyPilot 글은 coding agent가 코드를 건드리기 전에 논문과 경쟁 구현을 읽도록 하면 llama.cpp CPU inference 최적화 품질이 실제로 올라간다고 주장했다. 4대의 cloud VM과 약 29달러 비용으로 TinyLlama 1.1B 기준 x86 text generation을 15%, ARM을 5% 끌어올렸다는 점이 핵심이다.
약 260포인트를 받은 Launch HN 글은 Freestyle을 coding agent용 인프라로 소개했다. 핵심은 sub-second VM startup, 실행 중인 sandbox의 live forking, pause-and-resume persistence, 내장 git hosting, 그리고 데모용 container가 아닌 full Linux VM이라는 점이다.
Sebastian Raschka가 2026년 4월 4일 공개한 글은 coding agent의 성능 차이가 단순히 base model보다 harness 설계에서 나온다고 주장한다. 그는 live repo context, prompt/cache reuse, structured tools, context reduction, session memory, bounded subagents를 여섯 가지 핵심 구성요소로 정리했고, Hacker News에서는 이를 Codex·Claude Code류 도구를 이해하는 실무적 기준으로 받아들였다.