HNで200 pointsを超えた理由はLaravel Cloudの一文ではなく、agent contextが広告枠になり得るという違和感だった。
#agents
RSSフィードHNはArtifactsを単なるGit hostingとして見なかった。agent sessionごとのstateをどう保存し、forkし、戻すかの問題として読んだ。
OpenAIはCodexを週300万超のdevelopersが使っているとし、desktop appをcode editorの外へ広げた。UpdateにはmacOS background computer use、in-app browser、gpt-image-1.5 image generation、90超のplugins、PR review workflow、SSH devboxes alpha、automations、memory previewが含まれる。
AutoProberはduct tape感のあるhardware hacking demoとしてHNを引きつけたが、議論はすぐにsafetyとprecisionへ移った。CNC、microscope、oscilloscope、agentを組み合わせるなら、sub-millimeterの誤差とstop conditionが主役になる。
AnthropicはClaude Designをresearch previewとして開き、Opus 4.7をprototype、slide、one-pager制作へ広げた。Pro、Max、Team、Enterprise利用者はdesign systemの自動適用、Canva/PPTX/PDF export、Claude Code handoffを試せる。
なぜ重要か: 長時間動くagentには、全メッセージを再投入せずに状態を保持する仕組みが必要になる。Cloudflareはprivate betaのAgent Memoryで、context windowを埋めずに必要な情報を再利用できると説明した。
HNが見ていたのは「CloudflareがAIをやる」という話ではなく、14以上のproviderを束ねるinference layerがagent appの運用を本当に楽にするかだった。CloudflareはAI Gateway、Workers AI bindings、multimodal catalogを一つのplatformとして描き、コメント欄はOpenRouterとの差、pricingの正確さ、catalogの重なりを詰めた。
HWE-BenchはLLM agent評価を小さなHDL taskからrepository-scaleのhardware repairへ移した。最高agentは全体で70.7%を解いたが、複雑なSoC-level projectでは65%未満に落ちた。
AIBuildAIはMLE-Benchで63.1%のmedal rateを報告し、AI model開発agentの評価軸を広げた。重要なのは、AutoMLの一部最適化ではなく設計、coding、debugging、training、tuningを一つのworkflowとして扱う点だ。
HNが反応したのは3X speedupの見出しよりplumbingだった。AndroidはClaude Code、Codex、Gemini CLIなどのagentに、IDEの推測ではなくきれいなterminal surfaceを渡せるのか。
IBM ResearchのVAKRAはagent評価をstatic Q&Aからexecutable tool environmentへ移した。62 domains、8,000+ locally hosted APIs、3-7 step reasoning chainsを含み、surface-level tool useとenterprise agent reliabilityの差を示している。
CloudflareはAutoRAGをAI Searchへ再構成し、agentがWorkersから作成・検索できるretrieval primitiveにした。Open betaではBM25とvectorのhybrid search、built-in storage、metadata boosting、cross-instance searchを具体的な無料枠で試せる。