信頼性の高いAIエージェント構築には精巧なプロンプトではなく決定論的な制御フローが不可欠だという主張がHNで552ポイントを獲得し注目を集めている。
#ai-agents
RSSフィード
Google DeepMindはEVE Onlineの開発元CCP Gamesとの研究パートナーシップを発表。複雑なプレイヤー主導の宇宙空間を安全なサンドボックスとして活用し、AIのメモリ・継続学習・長期計画能力の研究を進める。
CloudflareとStripeが共同設計した新プロトコルにより、AIエージェントがクラウドアカウント作成・ドメイン登録・課金・デプロイを人手なしで処理できるようになった。
元Twitter CEOのParag Agrawalが創業したParallel Web Systemsが4月29日、Sequoia主導の1億ドルシリーズBを完了した。評価額は20億ドルで、5ヶ月前のシリーズAから3倍増。AIエージェント向け検索APIに特化したインフラを提供する。
Anthropicが金融サービス向けに10種の即戦力Claudeエージェントテンプレートをリリース。ピッチブック作成からKYCスクリーニング、月次決算まで対応し、Claude Opus 4.7はVals AI金融エージェントベンチマークで64.37%を達成し業界トップに立った。
Anthropicが金融サービスの最も時間のかかる業務向けに10種類のエージェントテンプレートを公開。Claude Opus 4.7は金融エージェントベンチマークで業界首位の64.37%を記録している。
同一の管理画面タスクをビジョンエージェントとAPIエージェントで比較したところ、ビジョン方式は約45倍高コストで、詳細なウォークスルーなしにはタスク完了も不可能だった。
HNが先に反応したのは文字列の奇妙さより信頼の崩れだった。最近のコミット履歴に大文字の <code>HERMES.md</code> があるだけでClaude Codeのリクエストがextra usage課金へ流れ、見えないルーティング規則が実費を燃やす構造が問題視された。
HNは1.0という数字そのものには長く留まらなかった。Zedが1.0を名乗った瞬間、速いRust製エディタが人間とClaude Code、Codexが同じ場所で働くための土台として本当に足りるのか、という実戦の問いにすぐ移った。
Hacker Newsが食いついたのはエージェントの“告白”ではなかった。ステージング作業が本番ボリューム削除へつながり、バックアップまで同じ爆発半径に置かれていたことが論点になった。
HNが反応した理由は、fake starsが単なるplatform spamではなく、AI/LLM repoの信用の見え方を歪めるからだった。threadはstar数よりcommit、issue、code、実利用の痕跡を見るべきだという実務的な方向へまとまった。
Factoryが$150 millionのSeries Cを調達し、valuationは$1.5 billionに達した。AI coding agentが個人向け開発支援からenterprise infrastructure予算へ向かう流れが強まっている。