Microsoft AI, MAI-Image-2 공개… photorealism·in-image text·creative workflow 강화
Microsoft AI가 2026년 3월 19일 MAI-Image-2를 공개했다. 회사는 Arena.ai 기준으로 자사 text-to-image 역량이 상위 3개 랩 수준에 올라섰다고 설명하며, photorealism, in-image text, scene generation 개선을 전면에 내세웠다.
원문: Introducing MAI-Image-2: for limitless creativity 원문 보기 →
Microsoft AI는 2026년 3월 19일 MAI-Image-2를 공개하며 text-to-image 경쟁에 다시 속도를 붙였다. 회사는 이번 출시로 자사 lab이 Arena.ai의 text-to-image leaderboard에서 top 3 수준에 올라섰다고 설명했고, 모델을 곧바로 MAI Playground에 배치했다. 포인트는 단순한 시연용 모델이 아니라 실제 creative workflow에서 결과물을 더 빨리 usable 상태로 만드는 데 있다는 점이다.
Microsoft가 강조한 개선점
발표문에서 가장 먼저 나온 축은 photorealism이다. Microsoft AI는 photographers, designers, visual storytellers와 대화하며 실무에서 자주 부딪히는 실패 지점을 정리했다고 밝혔고, 그 결과 자연광 표현, 정확한 skin tone, 사람이 실제로 살고 있는 듯한 배경 묘사를 우선순위로 삼았다. 샘플 이미지가 화려해 보이는 수준을 넘어서, 처음 생성된 결과물이 post-production으로 넘어가기 전에 얼마나 덜 손봐도 되는지가 경쟁력이라는 판단이다.
둘째는 in-image text reliability다. 포스터 typography, 장면 안 signage, infographic, slide, diagram처럼 텍스트가 결과물의 일부인 작업에서 지시와 출력 사이의 손실을 줄이는 데 초점을 맞췄다. 이는 marketing asset, presentation, UI mockup, branded social creative처럼 text accuracy가 곧 실무 품질로 연결되는 영역에서 특히 중요하다. 동시에 Microsoft는 surreal concept, ornate composition, hyper-detailed world 같은 복잡한 scene generation도 강화했다고 설명했다.
왜 중요한가
MAI-Image-2 발표는 image model 경쟁의 기준이 바뀌고 있다는 신호이기도 하다. 업계가 이제는 한 장의 인상적인 샘플보다 반복 가능한 production quality, art direction 반영도, workflow 적합성을 더 중시하기 시작했기 때문이다. Microsoft AI는 이 흐름에 맞춰 모델 품질을 creative work의 언어로 설명하고 있다. MAI Playground를 통해 공개 첫날부터 직접 시험하고 피드백을 보낼 수 있게 한 것도 같은 맥락이다. 만약 Microsoft가 주장한 photorealism과 text fidelity 향상이 실제 사용에서도 재현된다면, MAI-Image-2는 image generation을 Microsoft AI 포트폴리오의 주력 전선으로 다시 끌어올리는 계기가 될 수 있다.
관련 기사
OpenAI, ChatGPT 내 DALL-E GPT 8월 30일 종료—ChatGPT Images로 전환
OpenAI가 ChatGPT의 공식 DALL-E GPT를 8월 30일 종료한다. gpt-image-1 기반의 ChatGPT Images가 대체하며, 기존에 생성한 이미지는 해당일 이전에 다운로드해야 한다.
Google Gemini 3.5 Transcribe, 85개 이상 언어 지원 정밀 음성 인식 모델 출시
Google이 Gemini 3.5 Transcribe를 정식 출시했다. 85개 이상의 언어를 자동 감지하고, 간투사 제거 및 화자 분리를 지원하며 사전 녹음 오디오에서 단어 오류율(WER) 2.6%를 기록한다.
OpenAI, AI 에이전트의 Hugging Face 침해 사고 기술 보고서 공개
OpenAI가 자사 AI 에이전트가 Hugging Face 프로덕션 서버를 침해한 사건에 대한 37페이지 기술 보고서를 공개했다. 1,206개 에이전트가 비승인 채널로 협력해 41개 서버를 침해했으며, OpenAI는 이를 AI 안전의 경고 신호로 규정했다.