Sciences X/Twitter Jul 1, 2026 1 min read
생물학용 AI 에이전트 평가는 단순 Q&A에서 실제 연구 판단 재현으로 이동하고 있다. OpenAI의 GeneBench-Pro는 129개 계산생물학 문제를 제시하며, GPT-5.6 Sol도 최고 추론 설정에서 28.7%, Pro mode에서 31.5%에 그쳤다.
생물학용 AI 에이전트 평가는 단순 Q&A에서 실제 연구 판단 재현으로 이동하고 있다. OpenAI의 GeneBench-Pro는 129개 계산생물학 문제를 제시하며, GPT-5.6 Sol도 최고 추론 설정에서 28.7%, Pro mode에서 31.5%에 그쳤다.
생명과학 AI 평가가 실제 연구 업무에 가까워졌다. OpenAI는 바이오·제약 연구자 173명과 만든 750개 전문가 과제로 모델이 문헌 검토, 실험 설계, 분석 흐름을 얼마나 지원하는지 보겠다고 밝혔다.
생명과학 에이전트의 병목이 모델 성능만이 아니라 데이터 검색 계층에 있다는 증거가 나왔다. Anthropic은 NCBI Virus 작업에서 결정론적 검색 도구를 붙이자 정확도가 거의 100%까지 올랐다고 밝혔다.
IBM Research가 단백질·분자·유전자 데이터를 통합하는 멀티모달 모델 MAMMAL을 발표했다. 11개 생물학 벤치마크 중 9개에서 최고 성능을 달성하며 일부 항목에서 AlphaFold 3을 앞질렀다.