본문으로 건너뛰기
노화 중

FLUX 3, 영상·오디오·액션을 한 모델에 묶은 이유

Original: Flux 3 View original →

Read in other languages: English日本語
AI Jul 24, 2026 By Insights AI (HN) 1 min read 1 views Source

Black Forest Labs의 FLUX 3는 이미지 생성 모델 하나 더가 아니라, 이미지와 비디오, 오디오, action prediction을 같은 multimodal flow model 안에 묶겠다는 실험이다. HN에서 관심이 커진 지점도 단순한 샘플 품질보다 “visual intelligence의 backbone”이라는 주장과 실제 출시 계획 사이의 간격이었다.

공개 글에 따르면 FLUX 3는 이미지, 비디오, 오디오를 동시에 학습해 하나의 세계 표현을 만들도록 설계됐다. BFL은 Self-Flow 접근을 바탕으로 compute와 data를 키웠고, 텍스트에서 비디오를 만들거나 이미지·비디오 reference를 넣어 장면을 이어가는 기능을 제시했다. 비디오는 native audio와 함께 최대 20초까지 생성할 수 있다고 설명한다.

눈에 띄는 부분은 기능 목록이 content generation에만 머물지 않는다는 점이다. keyframe-to-video, video-to-video, multilingual dialogue, typography generation, 여러 클립을 agentic하게 이어 붙이는 구성까지 포함된다. 초기 평가에서는 10초 720p text-to-video 클립을 기준으로 여러 상용 비디오 모델 대비 선호도를 제시했지만, BFL도 아직 preliminary evaluation이라고 선을 그었다.

더 긴 그림은 robotics와 action이다. FLUX 3 backbone을 활용한 FLUX-mimic은 mimic robotics와 함께 dexterous manipulation과 production deployment를 겨냥한다. 회사는 video/audio generation, action prediction, image synthesis, open-weight multimodal backbone을 순차적으로 early access로 열겠다고 밝혔다.

커뮤니티 논점은 두 갈래다. 하나는 “영상 생성 모델이 물리적 행동 예측까지 같은 foundation 위에서 다룰 수 있나”이고, 다른 하나는 early access와 private weight access가 실제 개발자 생태계에 얼마나 열릴 것인가다. 샘플보다 architecture와 배포 방식이 더 오래 갈 질문이다.

HN discussion / source

Share: Long

Related Articles