Pass rate보다 token과 탐색 비용이 논점이다. HN 토론은 “성공률은 같아도 작업 흔적은 달라진다”는 지점을 파고들었다.
#agents
RSS 피드터미널 안의 Copilot이 일회성 명령 보조에서 팀별 실행 절차를 반복하는 에이전트로 넓어진다. GitHub는 보안 감사, 릴리스 노트, 인시던트 대응 등 최소 4가지 반복 작업을 Markdown 프로필로 고정할 수 있다고 설명했다.
Safari Technology Preview 247에 들어간 MCP server는 agent가 DOM, 네트워크, 콘솔, 스크린샷을 직접 보게 하는 쪽으로 설계됐다.
agent 성능 개선이 항상 새 모델이나 fine-tuning을 뜻하지는 않는다. Microsoft Research의 SkillOpt는 GPT-5.5 direct chat 6개 benchmark 평균을 58.8에서 82.3으로 올렸고, 52개 평가 셀에서 최고 또는 공동 최고를 기록했다.
점수보다 논점이 더 흥미롭다. HN 댓글은 새 benchmark 자체보다 “시니어 엔지니어”를 어떻게 재현할 수 있느냐에 모였다.
연구용 AI가 채팅창이 아니라 재현 가능한 작업 환경으로 이동한다. Claude Science는 60개 이상 과학 skill·connector, reviewer agent, HPC/SSH/Modal 연동을 묶고 최대 50개 프로젝트에 $30,000 크레딧을 지원한다.
낮은 가격대의 Sonnet 모델이 agent 작업에서 Opus 4.8에 가까운 구간까지 올라섰다. Free·Pro 기본 모델과 API, Claude Code에 동시에 들어오며, 8월 31일까지 입력 100만 토큰당 $2·출력 100만 토큰당 $10의 도입 가격이 적용된다.
Chamath Palihapitiya가 세운 8090 Labs가 Salesforce Ventures 주도 Series A에서 $135M을 확보했다. 목표는 개인용 vibe coding이 아니라 감사 추적과 통제를 갖춘 기업용 Software Factory다.
Microsoft Research가 Memora를 저장 내용과 검색 방식을 분리한 에이전트 기억 시스템으로 소개했다. 연구 블로그는 LoCoMo와 LongMemEval에서 Mem0, RAG, full-context inference를 앞서며 컨텍스트 토큰을 최대 98% 줄였다고 설명한다.
Databricks가 Omnigent를 여러 에이전트 위에 놓이는 오픈 meta-harness로 제시했다. 공통 인터페이스, 정책 적용, 실시간 협업을 한 계층에서 다룬다는 점이 핵심이며 Data + AI Summit에서 공개된 내용이다.
GitHub이 Copilot agentic harness를 SWE-bench Verified, SWE-bench Pro, SkillsBench, TerminalBench, Win-Hill에서 비교했다. 같은 모델·같은 과제 조건에서 해결률은 모델 기본 하네스와 비슷했고, 대부분의 구성에서 토큰 사용량은 더 낮았다는 점이 핵심이다.
코딩 에이전트 보안의 논점은 “.env를 읽지 말라”보다 넓다. 열린 Codex issue와 HN 댓글은 ignore 규칙, sandbox, Unix 권한, 컨테이너 경계가 어디서 나뉘는지 파고들었다.