DeepMind AI 공동임상의, 1차진료 질의 98건 중 97건 중대 오류 없음
이번 결과의 핵심은 의사 대체가 아니라 보조 정확도다. Google DeepMind는 AI 공동임상이 현실적인 1차진료 질의 98건 중 97건에서 중대 오류 없이 답했고, 멀티모달 원격진료 시뮬레이션에서는 의사가 여전히 전체적으로 앞섰다고 밝혔다.
태그
#multimodal 태그가 달린 기사
이번 결과의 핵심은 의사 대체가 아니라 보조 정확도다. Google DeepMind는 AI 공동임상이 현실적인 1차진료 질의 98건 중 97건에서 중대 오류 없이 답했고, 멀티모달 원격진료 시뮬레이션에서는 의사가 여전히 전체적으로 앞섰다고 밝혔다.
멀티모달 에이전트의 병목은 정확도보다 처리량이다. NVIDIA Nemotron 3 Nano Omni는 최대 9배 높은 처리량, 256K 컨텍스트, 6개 리더보드 1위를 앞세워 그 병목을 정면으로 겨냥했다.
멀티모달 에이전트는 아직 비전·오디오·텍스트 모델을 따로 엮느라 비용과 지연을 치른다. NVIDIA는 Nemotron 3 Nano Omni로 30B 파라미터, 256K 문맥, 동일 반응성 기준 영상 추론 시스템 용량 최대 9.2배를 내세웠다.
이 릴리스가 큰 이유는 대형 모델 한 묶음이 닫힌 API가 아니라 느슨한 라이선스로 바로 풀렸기 때문이다. MiMo-V2.5는 1M 토큰 컨텍스트, 상용 사용과 파인튜닝을 허용하는 MIT 라이선스, 그리고 GDPVal-AA·ClawEval 오픈모델 1위를 내세운 Pro 버전을 함께 내놨다.
중요한 점은 retrieval stack이 text-only search에서 multimodal memory로 이동하고 있다는 데 있다. Google AI Studio는 Gemini Embedding 2가 GA가 됐고 text, image, video, audio, documents 5개 입력을 하나의 model path로 다룬다고 적었다.
중요한 점은 Anthropic이 Claude를 텍스트와 코드뿐 아니라 시각적 작업물 생성으로 넓히고 있다는 데 있다. 트윗은 Claude Design이 Opus 4.7 기반이며 Pro, Max, Team, Enterprise plan에 research preview로 배포된다고 밝혔다.
MM-WebAgent는 AI가 만든 웹페이지가 왜 그럴듯한 조각들의 조합에 머무는지 겨냥한다. 계층형 planning, self-reflection, benchmark, code/data 공개를 통해 code-only 평가를 넘어 multimodal page coherence를 재는 틀을 제시했다.
중요한 점은 Alibaba가 multimodal coding model을 API 전용이 아니라 open weights로 풀었다는 데 있다. 트윗은 Qwen3.6-35B-A3B가 35B total parameters, 3B active parameters, Apache 2.0 license를 갖췄다고 적었고, 블로그는 SWE-bench Verified 73.4와 Terminal-Bench 2.0 51.5를 제시했다.
54점 Reddit post는 merged PR #19441을 통해 qwen3-omni-moe와 qwen3-asr support가 llama.cpp에 들어왔다고 알렸고, 댓글은 local multimodal과 ASR 실사용 기대를 드러냈다.
AI at Meta는 2026년 4월 8일 X에서 Muse Spark를 tool use, visual chain of thought, multi-agent orchestration을 지원하는 natively multimodal reasoning model로 소개했다. Meta 공식 발표는 이 모델이 이미 Meta AI app과 meta.ai를 구동하고 있으며, 앞으로 WhatsApp, Instagram, Facebook, Messenger, AI glasses로 확장되고, selected partners 대상 private-preview API도 제공된다고 설명한다.
Meta는 2026년 4월 8일 Meta Superintelligence Labs의 첫 모델 Muse Spark를 공개했다. 이 모델은 이미 Meta AI 앱과 웹을 구동하고 있으며, WhatsApp, Instagram, Facebook, Messenger, AI glasses로도 확장될 예정이다.
Google은 2026년 3월 26일 Search Live를 AI Mode가 이미 제공되는 모든 언어와 국가로 확대한다고 밝혔다. 200개+ 국가와 지역으로 넓어지는 이번 rollout은 Gemini 3.1 Flash Live를 기반으로 search를 더 conversational하고 voice-first하며 camera-aware한 경험으로 밀어 올린다.