ChatGPT 건강 답변, 사실 오류 신호 71% 감소… 무료 모델까지 확대
매주 2억3000만 명이 건강 질문에 쓰는 ChatGPT에서 사실성 문제가 크게 줄었다. GPT-5.5 Instant는 HealthBench Professional 등 의사 주도 평가에서 frontier Thinking 모델에 가까운 성능을 보였고, 무료 사용자에게도 제공된다.
원문: Improving health intelligence in ChatGPT 원문 보기 →
건강 질문은 ChatGPT에서 가장 민감한 사용처 중 하나다. OpenAI는 매주 2억3000만 명 이상이 건강·웰니스 질문에 ChatGPT를 사용한다고 밝히며, GPT-5.5 Instant에서 건강 답변의 정확도와 안전성 지표가 크게 개선됐다고 공개했다.
가장 눈에 띄는 숫자는 71%다. OpenAI는 최근 2개월 동안의 실제 건강 관련 사용 트래픽을 개인정보 보호 방식으로 모니터링한 결과, 사실성 문제가 하나 이상 표시된 답변 비율이 71% 감소했다고 설명했다. 단순한 데모가 아니라 매주 수십억 건 규모의 메시지 흐름에서 관찰한 변화라는 점이 중요하다.
평가 방식도 의료 도메인에 맞춰 조정됐다. OpenAI는 HealthBench와 HealthBench Professional 같은 의사 작성 루브릭을 사용해 정확성, 안전성, 맥락 파악, 완결성, 적절한 진료 권고를 살폈다. GPT-5.5 Instant는 이 집계 평가에서 최신 frontier 모델과 비슷한 수준에 도달했고, GPT-5.3 Instant보다 뚜렷하게 나아졌다는 설명이다.
의사 비교 평가도 포함됐다. 의사들이 인터넷을 사용할 수 있는 조건에서 대표 건강 대화에 답변을 작성했고, 별도 의사 패널이 총 3,500개 응답을 비교했다. OpenAI에 따르면 GPT-5.5 Instant 응답은 정확성, 소통, 완결성, 지시 준수, 건강 의사결정 도움 기준에서 과거 모델과 의사 작성 응답보다 높은 평가를 받았다.
다만 이것이 진단 자동화를 뜻하지는 않는다. OpenAI가 강조한 개선점은 긴급 진료가 필요한 상황을 더 잘 알아차리고, 필요한 맥락을 묻고, 불확실성을 과장하지 않는 답변이다. 건강 AI 경쟁의 다음 쟁점은 모델 점수보다 실제 사용자에게 위험한 확신을 얼마나 줄이는가에 가까워지고 있다.
관련 기사
AI가 난제를 풀면 수학은 전진할까, Reddit이 갈린 지점
172표가 모인 토론은 AI의 수학 성과를 둘러싼 갈등이 단순한 찬반이 아님을 보여줬다. 한쪽은 인간 연구자의 공로와 검증 절차를 묻고, 다른 쪽은 실제 문제 해결을 인정하지 않는 ‘기준 이동’이라고 맞섰다.
바이트댄스 AI 신약 개발 스핀오프 Anew Labs, 2억 9,000만 달러 첫 외부 투자 유치
바이트댄스에서 분사한 AI 신약 개발 스타트업 Anew Labs가 2억 9,000만 달러를 조달하며 기업 가치 15억 달러를 인정받았다. HSG·IDG Capital·Hillhouse가 투자를 주도했으며, 바이트댄스는 56% 지분을 유지했다.
3,915개의 삼체 궤도를 한 곳에—수학과 시각화의 교차점
threebodyorbits.com은 뉴턴 삼체 문제의 주기적 해법 3,915개를 기계 정밀도로 재계산해 인터랙티브하게 시각화한 아틀라스다. 주기, 에너지, 각운동량, 최근접 거리, 선형 안정성 데이터와 함께 제공되며, 해커뉴스에서 231점을 받았다.