본문으로 건너뛰기

태그

#multimodal

#multimodal 태그가 달린 기사

RSS 피드
LLM

OpenAI, 더 빠른 coding·subagent용 GPT-5.4 mini·nano 출시

OpenAI가 March 17, 2026 GPT-5.4 mini와 nano를 공개했다. mini는 GPT-5 mini보다 2x 이상 빠르면서 coding, reasoning, multimodal understanding, tool use를 끌어올렸고, nano는 classification·data extraction·ranking·간단한 coding subagents용 초저비용 모델로 배치됐다.

2분 소요 47 조회
과학 X/Twitter

PaperQA3, 150M+ 논문·특허를 읽는 Edison 과학 deep-research agent로 확장

NVIDIA AI Dev는 2026년 3월 27일 Edison의 PaperQA3가 1억 5천만 건이 넘는 연구 논문과 특허를 추론 대상으로 다루고 LABBench2에서 강한 성능을 냈다고 소개했다. Edison 글에 따르면 이 multimodal 시스템은 이제 figures와 tables를 읽고 수백 개의 시각 자료를 비교한 뒤 답변할 수 있다.

2분 소요 41 조회
LLM X/Twitter

Google DeepMind, 저지연 voice·vision agent용 Gemini 3.1 Flash Live 공개

Google DeepMind는 2026년 3월 26일 Gemini 3.1 Flash Live가 Google AI Studio의 Live API를 통해 preview로 제공된다고 밝혔다. Google 블로그에 따르면 이 모델은 실시간 voice·vision agent를 겨냥하며, noisy 환경에서의 tool triggering을 개선하고 90개가 넘는 언어의 multimodal 대화를 지원한다.

2분 소요 48 조회
LLM X/Twitter

NVIDIA, Nemotron Nano 12B v2 VL을 온프레미스 영상 이해용 경량 오픈 모델로 전면 배치

NVIDIA는 2026년 3월 25일 Nemotron Nano 12B v2 VL이 온프레미스 video understanding을 지원하며, 자사 설명 기준으로 MediaPerf benchmark에서 30B급 대안에 가까운 성능을 더 작은 footprint로 낸다고 밝혔다. NVIDIA 모델 카드는 이를 multi-image reasoning, video understanding, visual Q&A, summarization을 위한 상용 가능 멀티모달 모델로 소개한다.

2분 소요 44 조회
LLM

Microsoft Research, Phi-4-reasoning-vision-15B 공개… multimodal reasoning 효율성 전면에

Microsoft Research가 2026년 3월 4일 15 billion parameter open-weight 모델 Phi-4-reasoning-vision-15B를 공개했다. 회사는 이 모델이 multimodal reasoning, math·science task, computer-use scenario에서 경쟁력 있는 성능을 내면서도 compute cost를 낮추는 데 초점을 맞췄다고 설명했다.

2분 소요 42 조회
LLM X/Twitter

OpenAI, GPT-5.4 mini를 ChatGPT, Codex, API에 확대

OpenAI는 2026년 3월 17일 X에서 GPT-5.4 mini가 ChatGPT, Codex, API에 출시됐다고 밝혔다. 회사는 mini를 더 빠른 coding과 multimodal 작업용 모델로 소개했고, 함께 공개한 공식 글에서는 API 전용 GPT-5.4 nano도 추가했다.

1분 소요 56 조회
LLM X/Twitter

Google, Gemini Embedding 2 공개… 텍스트·이미지·오디오·비디오·문서를 하나의 벡터 공간으로

Google AI Studio는 2026-03-12 X 게시물에서 Gemini Embedding 2를 소개했고, Google의 2026-03-10 블로그 글은 이 model이 text, images, video, audio, documents를 하나의 embedding space로 매핑한다고 설명한다. Google은 이 model이 Gemini API와 Vertex AI에서 public preview로 제공되며 multimodal retrieval과 classification을 주요 활용처로 내세운다고 밝혔다.

2분 소요 39 조회
LLM X/Twitter

Mistral AI, NVIDIA와 open frontier models 공동 개발… Nemotron Coalition 합류

Mistral AI는 2026년 3월 16일 NVIDIA와 frontier open-source AI models를 공동 개발하는 전략적 파트너십에 들어간다고 밝혔다. 이어진 Mistral 공식 글은 Mistral이 NVIDIA Nemotron Coalition의 founding member로 참여하며 large-scale model development와 multimodal capabilities를 제공한다고 설명한다.

2분 소요 48 조회