Laravel agent 지침 논쟁, HN은 agent 광고 문제로 읽었다
HN이 200점 넘게 반응한 이유는 Laravel Cloud 문구 하나보다, agent context가 새로운 광고 지면이 될 수 있다는 불편함이었다.
태그
#agents 태그가 달린 기사
HN이 200점 넘게 반응한 이유는 Laravel Cloud 문구 하나보다, agent context가 새로운 광고 지면이 될 수 있다는 불편함이었다.
HN은 Artifacts를 단순한 Git hosting으로 보지 않았다. agent session 수가 폭증할 때 state를 어떻게 저장하고 fork할지의 문제로 읽었다.
OpenAI는 Codex를 매주 300만 명이 넘는 developers가 쓰고 있다고 밝히며, desktop app을 code editor 밖으로 확장했다. 이번 update에는 macOS background computer use, in-app browser, gpt-image-1.5 image generation, 90개+ plugins, PR review workflow, SSH devboxes alpha, automations, memory preview가 포함됐다.
AutoProber는 duct tape 감성의 hardware hacking demo로 HN의 눈을 끌었지만, 댓글은 곧 “AI가 실제로 무엇을 제어하나”로 향했다. CNC, microscope, oscilloscope, safety endstop을 묶은 project는 멋있지만, physical agent에는 sub-millimeter precision과 stop condition이 핵심이다.
Anthropic이 Claude Design을 research preview로 열며 Opus 4.7을 prototype, slide, one-pager 제작 workflow에 붙였다. Pro, Max, Team, Enterprise 사용자는 design system 자동 적용, Canva/PPTX/PDF export, Claude Code handoff까지 한 화면에서 테스트하게 된다.
왜 중요한가: 장시간 실행되는 agent는 모든 메시지를 다시 넣지 않고도 이전 상태를 기억해야 한다. Cloudflare는 private beta로 공개한 Agent Memory가 context window를 채우지 않으면서 필요한 정보를 다시 제공한다고 설명했다.
HN의 관심은 “Cloudflare가 AI를 한다”가 아니라, 14개 이상 provider를 묶는 inference layer가 agent 개발자의 실제 배관 문제를 줄여주느냐였다. Cloudflare 글은 AI Gateway, Workers AI binding, multimodal model catalog를 한 흐름으로 묶었고, 댓글은 OpenRouter와의 차이, pricing 신뢰도, model catalog의 일관성을 따졌다.
HWE-Bench는 LLM agent 평가를 작은 HDL 문제에서 repository-scale hardware repair로 옮겼다. 최고 agent는 전체 70.7%를 해결했지만, 복잡한 SoC-level project에서는 65% 아래로 떨어졌다.
AIBuildAI는 MLE-Bench에서 63.1% medal rate를 보고하며 AI model 제작 agent의 기준선을 끌어올렸다. 핵심은 AutoML의 일부 최적화가 아니라 설계, coding, debugging, training, tuning을 하나의 workflow로 묶었다는 점이다.
HN이 주목한 것은 headline의 3X speedup보다 plumbing이었다. Android가 Claude Code, Codex, Gemini CLI 같은 agent에게 IDE 추측이 아닌 깨끗한 terminal surface를 줄 수 있느냐는 질문이다.
IBM Research의 VAKRA는 agent benchmark를 static Q&A에서 실행 가능한 tool environment로 옮겼다. 62 domains, 8,000+ locally hosted APIs, 3-7 step reasoning chains가 들어가며, 결과는 agent reliability가 아직 tool demo 수준을 넘기 어렵다는 쪽에 가깝다.
Cloudflare가 AutoRAG를 AI Search로 바꾸며 agent용 retrieval을 별도 infra 작업에서 Workers binding으로 끌어왔다. Open beta 기간에는 built-in storage, vector index, BM25 hybrid search, cross-instance search를 무료 한도 안에서 쓸 수 있다.