本文へスキップ

13,917人の症状対話で試したGoogle SymptomAI、医師DDxとの比較へ

Original: SymptomAI: Towards a conversational AI agent for everyday symptom assessment View original →

Read in other languages: 한국어English
Sciences Jul 24, 2026 By Insights AI 1 min read Source

symptom checker AIの評価軸が、きれいに整えられた医療問題から実際の会話へ移った。Google Researchが2026年7月22日に公開した SymptomAI研究は、13,917人の同意参加者が自分の症状を自然に説明した対話を使っている。

実験では、Gemini Flash 2.0を基盤にした5種類のSymptomAI agentを無作為に割り当てた。agentは症状を聞き取り、follow-up questionを行い、differential diagnosis、つまり可能性のある診断候補リストを作成する。参加者はその後、医療機関を受診して得た診断を2週間後に報告した。

評価は臨床医との比較で行われた。3人のboard-certified clinicianが会話記録をblind reviewし、SymptomAIと臨床医が出したDDxを比較した。最も目立つ数字は53.3%で、専門家は1位候補としてSymptomAIのDDxを選ぶ割合が臨床医baselineより高いと評価した。top-5 accuracyでも、参加者が医療機関で報告した診断が候補内に入る割合はSymptomAI側が上回った。

この研究で重要なのは、モデルが何を答えたかだけではない。agentが追加情報を取りにいく問診型の設計は、ユーザーが単にLMへ症状を入力するbase条件より良い結果を出した。医療AIの品質はモデル性能だけでなく、質問の順序、聞き漏らしの補完、会話設計に左右される。

Fitbit wearable dataとの照合も試された。SymptomAIが呼吸器感染をtop-1候補にした参加者群では、症状報告日前後に心血管、呼吸、皮膚温、睡眠の指標変化が見られた。ただし研究チームは、この診断ラベルが研究分析用であり、公式な臨床診断ではないと明記している。次に問われるのは、遠隔問診とwearable signalをどこまで安全に検証できるかだ。

Share: Long

Related Articles