本文へスキップ

Gemini Enterprise、20超の指標でagent品質を本番監視へ

Original: Agent and Model Evaluations in Gemini Enterprise Agent Platform are now GA View original →

Read in other languages: 한국어English
LLM Aug 2, 2026 By Insights AI 1 min read Source

企業向けagentの問題は、動くデモを作ることから、本番で品質を測り続けることへ移っている。Googleは Gemini Enterprise Agent PlatformのAgent and Model Evaluationsを一般提供にし、開発中の実験と実運用のtraceを同じ評価エンジンで比較できるようにした。

この機能の狙いは、評価のものさしをそろえることだ。本番でスコアが落ちたとき、agentの設計が悪化したのか、入力分布が変わったのか、評価方法が変わったのかを切り分ける必要がある。Googleによると、品質、安全性、grounding、tool use、trajectory、参照ベース評価などにまたがる20以上の事前構築済み指標が用意される。

要約にはROUGE、翻訳にはBLEU、MetricX、COMET、抽出型QAにはexact matchのような決定的な指標を使える。一方で、agentの行動評価のように唯一の正解文字列がない領域では、code-based metricやLLM-as-a-judge metricを追加できる。

特に重要なのが、Google DeepMindと共同で設計したadaptive rubricsだ。すべての入力に同じjudge promptを当てるのではなく、評価ケース、開発者の指示、tool宣言からケースごとの合否基準を生成する。Task Success、Tool Use Quality、Safety、Trajectory Quality、Final Response Quality、Hallucination、Groundingなどを同じ枠組みで扱える。

運用機能も含まれる。実験はclient側またはserver側で実行でき、server側では成果物をCloud Storageに保存して監査と再現性を確保する。case generationで評価データを作り、user simulatorで複数ターンの会話を再現し、environment simulatorでagentが呼び出す外部システムの遅延や失敗を模擬できる。

本番導入後は、既存のtelemetryとtraceを継続評価し、score-over-time chartやdrift alertを出せる。大規模な評価ではfailureをtaxonomyに沿ってまとめるissue clusteringも使える。agent開発の競争軸が、promptの巧さだけでなく、品質を説明できる運用基盤へ広がっている。

Share: Long

Related Articles