FLUX 3, 영상·오디오·액션을 한 모델에 묶은 이유
Original: Flux 3 View original →
Black Forest Labs의 FLUX 3는 이미지 생성 모델 하나 더가 아니라, 이미지와 비디오, 오디오, action prediction을 같은 multimodal flow model 안에 묶겠다는 실험이다. HN에서 관심이 커진 지점도 단순한 샘플 품질보다 “visual intelligence의 backbone”이라는 주장과 실제 출시 계획 사이의 간격이었다.
공개 글에 따르면 FLUX 3는 이미지, 비디오, 오디오를 동시에 학습해 하나의 세계 표현을 만들도록 설계됐다. BFL은 Self-Flow 접근을 바탕으로 compute와 data를 키웠고, 텍스트에서 비디오를 만들거나 이미지·비디오 reference를 넣어 장면을 이어가는 기능을 제시했다. 비디오는 native audio와 함께 최대 20초까지 생성할 수 있다고 설명한다.
눈에 띄는 부분은 기능 목록이 content generation에만 머물지 않는다는 점이다. keyframe-to-video, video-to-video, multilingual dialogue, typography generation, 여러 클립을 agentic하게 이어 붙이는 구성까지 포함된다. 초기 평가에서는 10초 720p text-to-video 클립을 기준으로 여러 상용 비디오 모델 대비 선호도를 제시했지만, BFL도 아직 preliminary evaluation이라고 선을 그었다.
더 긴 그림은 robotics와 action이다. FLUX 3 backbone을 활용한 FLUX-mimic은 mimic robotics와 함께 dexterous manipulation과 production deployment를 겨냥한다. 회사는 video/audio generation, action prediction, image synthesis, open-weight multimodal backbone을 순차적으로 early access로 열겠다고 밝혔다.
커뮤니티 논점은 두 갈래다. 하나는 “영상 생성 모델이 물리적 행동 예측까지 같은 foundation 위에서 다룰 수 있나”이고, 다른 하나는 early access와 private weight access가 실제 개발자 생태계에 얼마나 열릴 것인가다. 샘플보다 architecture와 배포 방식이 더 오래 갈 질문이다.
Related Articles
Together AI는 2026년 4월 3일 Alibaba Cloud의 Wan 2.7이 자사 플랫폼에 들어온다고 밝혔다. 함께 공개된 제품 글은 text-to-video를 지금 바로 제공하고, image-to-video·reference-to-video·video edit를 같은 API·인증·과금 표면 위로 확장하겠다고 설명한다.
구글 딥마인드가 Google I/O 2026에서 텍스트·이미지·오디오·영상 등 모든 입력으로 영상을 생성하는 Gemini Omni를 공개했다. Gemini의 지능과 구글 생성형 미디어 기술의 결합으로, Gemini 앱과 YouTube Shorts를 통해 즉시 이용 가능하다.
NVIDIA Research의 MOTIVE는 video model fine-tuning에서 움직임에 실제로 기여하는 clip을 골라내는 방법이다. ICML 2026 Outstanding Paper Honorable Mention을 받았고, base model 대비 74.1% human preference를 기록했다.