Qwen-Image-2.0: 7B 통합 모델로 생성과 편집을 동시에
Qwen 팀이 생성과 편집을 하나의 파이프라인으로 통합한 7B 이미지 모델을 공개했습니다. 네이티브 2K 해상도, 실제 텍스트 렌더링, 멀티패널 만화 생성 등을 지원하며, 20B였던 v1 대비 크기를 대폭 줄여 추론 속도를 크게 개선했습니다.
원문: Qwen-Image-2.0 is out - 7B unified gen+edit model with native 2K and actual text rendering 원문 보기 →
생성과 편집의 통합
Qwen 팀이 Qwen-Image-2.0을 공개했습니다. 이전처럼 생성과 편집을 위한 별도 모델이 필요하지 않습니다. 7B 파라미터 하나로 두 작업을 모두 처리할 수 있습니다.
주요 특징
- 네이티브 2K 해상도 (2048×2048) - 피부, 직물, 건축물 등의 텍스처가 진짜처럼 사실적
- 실제 텍스트 렌더링 - 최대 1K 토큰 프롬프트에서 텍스트 생성. 포스터, 인포그래픽, PPT 슬라이드, 중국 서예까지 지원. 모든 diffusion 모델의 고질적 문제를 진지하게 해결
- 통합 생성 및 편집 - 동일 모델에서 생성하고 편집. 텍스트 오버레이 추가, 이미지 합성, 스타일 변경 등 파이프라인 전환 없음
- 멀티패널 만화 (4×6) - 일관된 캐릭터와 정렬된 말풍선. 7B 모델치고는 놀라운 기능
성능 개선
v1의 20B에서 7B로 축소되어 추론 속도가 훨씬 빨라졌습니다. 현재 API는 Alibaba Cloud에서 초대제로 운영 중이며, Qwen Chat에서 무료 데모를 사용할 수 있습니다.
중국 AI 랩의 조용한 약진
Reddit 커뮤니티는 "중국 연구소들이 모두가 LLM 경쟁에 집중하는 동안 조용히 강력한 비주얼 모델을 계속 출시하고 있다"고 평가했습니다.
특히 텍스트 렌더링 문제는 Stable Diffusion, DALL-E, Midjourney 등 거의 모든 이미지 생성 모델의 고질적인 약점이었습니다. Qwen-Image-2.0이 이를 어느 정도 해결한 것은 이미지 생성 분야에 의미 있는 진전입니다.
관련 기사
Qwen-Image-2.0 공개: 7B 파라미터로 2K 이미지 생성 및 편집 통합
Alibaba Qwen 팀이 7B 파라미터 통합 이미지 생성·편집 모델 Qwen-Image-2.0을 발표했다. 20B였던 v1 대비 크기를 대폭 줄이면서도 2K 해상도, 실제 텍스트 렌더링, 멀티 패널 만화 생성 등 향상된 기능을 제공한다.
Qwen Image 2.0 Pro, 다국어 텍스트 품질 끌어올리며 텍스트-투-이미지 9위 진입
이미지 생성 모델이 가장 자주 무너지는 지점은 글자와 레이아웃이라서 이번 업데이트는 실무 영향이 크다. Qwen은 신모델을 내놓으며 텍스트-투-이미지 글로벌 9위와 다국어 타이포그래피 개선을 함께 내세웠다.
ChatGPT Images 2.5, 생성 지연 50% 줄이고 반복 편집 일관성·API 2종 강화
이미지 생성의 병목이 첫 결과보다 반복 수정으로 옮겨간다. ChatGPT Images 2.5는 이전 버전보다 생성 지연을 최대 50% 줄이고, 부분 수정과 다중 턴 일관성을 강화했으며 API용 Flare·Sunburst 2종을 함께 공개했다. 전 사용자 배포도 시작됐다.