알리바바, 경량 통합 이미지 생성 모델 Qwen-Image-2.1 출시
알리바바 클라우드가 Qwen 시리즈 이미지 생성 모델의 최신 버전 Qwen-Image-2.1을 공개했다. 소형화·효율화와 함께 다양한 이미지 생성 작업을 단일 모델로 처리하는 통합 아키텍처가 핵심이다.
원문: Qwen-Image-2.1: Compact, efficient, and unified image creation 원문 보기 →
Qwen 이미지 모델의 진화
알리바바 클라우드의 Qwen(통의천문) 시리즈는 텍스트, 코드, 오디오, 이미지 등 멀티모달 AI 분야에서 빠르게 성장해온 오픈소스 AI 패밀리다. 이번에 발표된 Qwen-Image-2.1은 이미지 생성 모델의 최신 버전으로, 경량(compact), 효율성(efficient), 통합(unified)을 세 가지 핵심 키워드로 내세운다.
주요 특징
공식 블로그에 따르면 Qwen-Image-2.1은 다음과 같은 특징을 갖는다:
- 경량 설계: 이전 버전 대비 모델 크기를 줄이면서 성능을 유지하거나 향상
- 효율적 추론: 동일한 하드웨어에서 더 빠른 이미지 생성 속도 구현
- 통합 아키텍처: 텍스트-투-이미지, 이미지 편집, 변환 등 다양한 작업을 단일 모델로 처리
오픈소스 이미지 생성 경쟁의 심화
Qwen-Image-2.1의 등장은 오픈소스 이미지 생성 모델 시장의 경쟁이 심화되고 있음을 보여준다. Stable Diffusion 계열, FLUX, DALL-E 등 상업 모델과 경쟁하면서, 알리바바는 특히 중국어권 텍스트 렌더링과 아시아 스타일 이미지 생성에서 강점을 보여왔다.
해커뉴스에서 261점을 기록하며 AI 커뮤니티의 높은 관심을 받았다. Qwen 시리즈가 이미지 생성 분야에서도 서양 중심 모델들에 필적하는 성능을 선보일지 주목된다.
관련 기사
Qwen-Image-2.0 공개: 7B 파라미터로 2K 이미지 생성 및 편집 통합
Alibaba Qwen 팀이 7B 파라미터 통합 이미지 생성·편집 모델 Qwen-Image-2.0을 발표했다. 20B였던 v1 대비 크기를 대폭 줄이면서도 2K 해상도, 실제 텍스트 렌더링, 멀티 패널 만화 생성 등 향상된 기능을 제공한다.
TypeSafe AI가 '혁신'이라 부른 것, 1년 전에 내가 만들었다 — Laya 공개
ConvAI Innovations의 창업자가 2025년 arXiv 논문으로 선보인 비자기회귀 결정 모델 아이디어를 TypeSafe AI가 1년 뒤 'Jev'로 내놓자, 오픈소스 버전 Laya를 공개했다. 35ms 이내 응답, 100개 이상 언어 지원.
브라우저에서 돌아가는 오픈소스 Jev 대안 'SemIf' 공개
TypeSafe AI의 Jev와 같은 비자기회귀 의사결정 모델을 백엔드 없이 브라우저에서 실행하는 오픈소스 프로젝트 SemIf(구 OpenJev)가 등장했다. MiniCPM5 2B 등 공개 모델로 로컬 추론이 가능하다.