알리바바 WAN 3.0: 30초·1080p·음성 동시 생성, 문서를 영상으로
전작 두 배 길이, 음성 포함
알리바바 Tongyi Lab이 8월 24일 영상 생성 AI 모델 WAN 3.0을 정식 출시했다. 공개 베타는 8월 초부터 시작됐으며, 이번 공식 릴리스에서 기업용 기능이 강화됐다. 전작 WAN 2.7의 최대 15초에 비해, WAN 3.0은 최대 30초의 1080p 영상을 오디오와 함께 단일 패스에서 생성한다.
문서 → 영상 변환이 핵심 차별점
WAN 3.0은 텍스트·이미지·영상·오디오 외에 DOC·XLS·PPT·PDF·Markdown 파일까지 입력으로 받는다. 기업 사용자는 프레젠테이션이나 스프레드시트를 그대로 업로드해 영상 콘텐츠로 변환할 수 있다. 지시 추종, 샷 간 일관성, 음질 모두 이전 버전 대비 개선됐다.
가격 및 이용 방법
API 표준 단가는 480p 초당 $0.05, 720p $0.10, 1080p $0.20이다. 8월 24일부터 9월 23일까지 선정 플랫폼에서 30% 할인 프로모션이 적용된다. Alibaba Cloud Model Studio와 Qwen Cloud(모델명: wan3.0-video)에서 사용 가능하다.
공식 발표: technode.com
Related Articles
IBM이 3B·8B·30B 규모의 오픈소스 추론 모델 Granite 4.2를 Apache 2.0으로 공개. 8B·30B 모델은 실제 소프트웨어 개발·터미널·웹 검색 환경에서 에이전트 강화학습을 거쳤으며 512K 토큰 컨텍스트와 12개 언어를 지원한다.
ByteDance가 공개한 Seedance 2.0은 텍스트·이미지·영상·음성 4가지 입력을 동시에 처리해 최대 20초 1080p 영상을 생성한다. 출시 하루 만에 Disney, Paramount 등 할리우드 스튜디오로부터 저작권 침해 법적 경고를 받으며 AI 영상 생성의 새 분쟁 국면을 열었다.
Together AI는 2026년 4월 3일 Alibaba Cloud의 Wan 2.7이 자사 플랫폼에 들어온다고 밝혔다. 함께 공개된 제품 글은 text-to-video를 지금 바로 제공하고, image-to-video·reference-to-video·video edit를 같은 API·인증·과금 표면 위로 확장하겠다고 설명한다.