HWE-Bench, 실제 hardware bug에서 agent 70.7% 수리율을 재다
HWE-Bench는 LLM agent 평가를 작은 HDL 문제에서 repository-scale hardware repair로 옮겼다. 최고 agent는 전체 70.7%를 해결했지만, 복잡한 SoC-level project에서는 65% 아래로 떨어졌다.
카테고리
Insights의 LLM 기사
HWE-Bench는 LLM agent 평가를 작은 HDL 문제에서 repository-scale hardware repair로 옮겼다. 최고 agent는 전체 70.7%를 해결했지만, 복잡한 SoC-level project에서는 65% 아래로 떨어졌다.
AIBuildAI는 MLE-Bench에서 63.1% medal rate를 보고하며 AI model 제작 agent의 기준선을 끌어올렸다. 핵심은 AutoML의 일부 최적화가 아니라 설계, coding, debugging, training, tuning을 하나의 workflow로 묶었다는 점이다.
LocalLLaMA는 1.58-bit model의 가능성에 반응했지만, thread는 곧 어려운 질문으로 향했다. 비교 대상이 quantized Qwen peers가 아니라 full-precision baseline이면 공정한가.
LocalLLaMA는 Claude identity verification을 단순한 account policy로 보지 않았다. local model, privacy control, 그리고 tool 접근 gate를 둘러싼 논쟁의 새 재료로 받아들였다.
HN이 이 농담 같은 테스트에 반응한 이유는 분명했다. 작은 local model의 선명한 SVG 한 장이 flagship model보다 좋아 보일 때, 그것이 무엇을 증명하는지 아무도 쉽게 합의하지 못한다.
IBM Research의 VAKRA는 agent benchmark를 static Q&A에서 실행 가능한 tool environment로 옮겼다. 62 domains, 8,000+ locally hosted APIs, 3-7 step reasoning chains가 들어가며, 결과는 agent reliability가 아직 tool demo 수준을 넘기 어렵다는 쪽에 가깝다.
Cloudflare가 Workers AI에서 Kimi K2.5를 3x faster로 만들었다고 밝혔다. p90 time per token은 약 100 ms에서 20-30 ms로 내려갔고, prompt cache hit ratio는 peak 기준 60%에서 80%로 올랐다.
Cloudflare가 AutoRAG를 AI Search로 바꾸며 agent용 retrieval을 별도 infra 작업에서 Workers binding으로 끌어왔다. Open beta 기간에는 built-in storage, vector index, BM25 hybrid search, cross-instance search를 무료 한도 안에서 쓸 수 있다.
LocalLLaMA의 열기는 “모델이 멍청해졌다”는 불평에서 끝나지 않고, provider routing과 quantization, peak-time behavior를 어떻게 측정할지로 번졌다. thread는 확정 증거보다 community가 느끼는 품질 불안의 크기를 보여준다.
HN 댓글의 열기는 새 model 이름보다 adaptive thinking, token 변화, safety filter가 실제 개발 흐름을 흔들지에 몰렸다. Opus 4.7은 높은 기대와 동시에 최근 Claude 품질 논쟁의 후폭풍을 맞고 있다.
Cloudflare가 AI Gateway를 agent용 통합 inference layer로 확장해 Workers AI에서 70+ models와 12+ providers를 같은 API로 호출하게 했다. 핵심은 catalog 숫자보다, 한 작업에 inference call이 10번씩 이어지는 agent workflow에서 비용·retry·failover를 한곳에 모으는 데 있다.
PrismML은 작은 open model이 architecture만이 아니라 weight format 변화로도 쓸 만해질 수 있는지 시험한다. Ternary Bonsai는 1.58 bits에서 8B, 4B, 1.7B 모델을 내고 8B variant는 1.75GB로 제시됐다.