Fable 5 biology fallback 85% 감소, 연구 접근성 넓힌 새 안전선
Claude Fable 5가 biology 관련 질문에서 덜 자주 더 약한 모델로 물러난다. Anthropic은 제품 전반 테스트에서 biology-related fallback이 약 85% 줄었다고 밝혔다.
카테고리
Insights의 과학 기사
Claude Fable 5가 biology 관련 질문에서 덜 자주 더 약한 모델로 물러난다. Anthropic은 제품 전반 테스트에서 biology-related fallback이 약 85% 줄었다고 밝혔다.
WeatherNext는 사이클론 경로와 강도 예측에서 평균 24시간의 추가 대비 시간을 제시한다. Google DeepMind는 Nature 게재 연구와 함께 코드와 모델 가중치를 공개해 현업 예보와 지역 특화 모델 개발까지 열어뒀다.
AI가 수학 연구의 비용 구조를 바꾸고 있다. OpenAI는 내부 Astra 모델이 약 $2,000 상당의 GPT-5.6 Sol 토큰으로 10개 난제 결과를 만들고 Lean 인증서까지 냈다고 밝혔다.
OpenAI가 미공개 모델 Astra로 수학·이론컴퓨터과학의 장기 미해결 문제 10건에 대한 새 결과를 냈다. 각 논증은 사람이 논문 형태로 정리한 뒤 Lean certificate로 형식 검증됐고, 탐색 비용은 Sol API 요금 기준 약 $2,000로 제시됐다.
OpenAI의 차기 모델 계열 Astra가 수학·이론컴퓨터과학의 장기 미해결 문제 10개에서 새 결과를 냈다. OpenAI는 전체 해법 탐색의 토큰 비용을 Sol API 기준 약 $2,000로 제시했고, 각 결과를 Lean 증명서와 함께 공개했다.
AI 연구 agent의 약점은 논문처럼 보이는 결과물이 아니라 검증되지 않는 주장이다. Google Research는 Science One Framework가 baseline의 phantom reference 최대 21%를 0으로 줄이고 점수 검증까지 통과했다고 공개했다.
임상 예시 문제가 아니라 실제 사용자가 말한 증상 대화 13,917건이 평가 대상이 됐습니다. Google Research의 SymptomAI 연구는 AI symptom checker 논의를 “의료 시험 문제 풀이”에서 원격 문진과 wearable biosignal 검증으로 옮깁니다.
Google DeepMind와 Google Cloud가 DOE Genesis Mission 연구자에게 $40M 규모의 AI 토큰과 cloud credit을 제공한다. 목표는 10년 안에 미국 과학 발견 속도를 두 배로 높이는 실험이며, 17개 DOE 국립연구소가 초기 기반이다.
미국 DOE light source 시설의 데이터 병목이 AI 실험 자동화 과제로 커졌다. Meta는 Berkeley Lab의 SYNAPS-I 프로젝트가 SAM 3와 DINOv3로 초당 100,000장까지 늘어난 detector 데이터를 처리한다고 소개했다.
Bristol Myers Squibb가 8대 DGX Vera Rubin NVL72 기반 두 번째 DGX SuperPOD를 도입해 전 세계 연구자가 쓰는 단일 AI 환경을 만든다. 기존 AI cluster에서 target identification 시간을 몇 주 줄인 뒤, drug discovery 전 과정으로 compute를 확대하는 결정이다.
프런티어 AI의 생물학적 오용 위험과 방어 활용이 동시에 커지고 있다. Google DeepMind와 Isomorphic Labs는 지난 12개월 동안 15개 이상 파트너십을 진전시켰다고 밝혔다.
AI가 만든 영상으로 특정 시각 뇌 영역의 반응을 최대화한다는 연구에 관심과 불안이 동시에 붙었다. NEvo는 뇌의 “digital twin”을 보상 함수처럼 쓰며, 연구 도구와 superstimulus 사이의 경계를 드러낸다.