상하이 AI 랩, 744B MoE 에이전트 모델 'Atria Dawn Preview' 오픈소스 공개
상하이 AI 랩이 장기 엔지니어링·연구 워크플로우 특화 에이전트 모델 Atria Dawn Preview를 MIT 라이선스로 공개했다. 744B 총 파라미터, 256K 컨텍스트, SWE-bench 2026 59.6%의 프론티어급 성능이다.
상하이 인공지능 실험실(Shanghai AI Lab)이 2026년 9월 15일 Atria Dawn Preview를 공개했다. 총 7440억 개의 파라미터를 가진 희소 혼합 전문가(MoE) 아키텍처로, 장기 엔지니어링·연구 워크플로우에 특화된 에이전트 언어 모델이다. MIT 라이선스로 배포되어 자체 호스팅이 가능하다.
성능과 사양
Atria Dawn Preview는 GLM-5.2 기반으로 256K 토큰 컨텍스트를 지원하며, FP8 가중치로 양자화되어 있다. 주요 벤치마크 성능은 SWE-bench 2026 기준 59.6%, AutomationBench 53.8(자율 장기 연구·엔지니어링 작업)이다. OpenAI 호환 API를 제공하며, 단순 채팅이 아닌 복잡한 멀티스텝 작업에 초점을 맞췄다.
연구 배경
이 모델은 상하이 AI 랩이 푸단대학교 자연어처리 연구소와 함께 운영하는 ATRIA 크로스-인스티튜셔널 이니셔티브에서 개발됐다. 총 143명의 공저자가 참여했으며, 기반 학습 기법은 ICLR 2026에서 발표된 두 편의 논문 TRINITY와 Conductor에서 비롯됐다. AI 시스템이 전문가 에이전트를 조립·라우팅·조율하는 방식을 학습하는 원리를 담고 있다.
배포 방식
FP8 양자화 체크포인트와 GitHub 리포지터리가 arXiv 보고서보다 사흘 앞서 공개되는 이례적인 방식으로 배포됐다. MIT 라이선스 적용으로 상업 목적 자체 호스팅도 허용한다.
관련 기사
StepFun, 6000억 파라미터 'Step 5 Preview' 출시 — 10월 오픈 가중치 공개 예정
중국 AI 스타트업 StepFun이 600B 희소 MoE 모델 Step 5 Preview를 공개했다. 100만 토큰 컨텍스트와 Intelligence Index 44점으로 Kimi K3 Max와 동등하며, 전체 오픈 가중치는 10월 15일 공개 예정이다.
DeepSeek V4, 이번 주 출시 예고… 1조 매개변수 멀티모달 AI 모델
중국 AI 연구소 DeepSeek이 텍스트·이미지·동영상·오디오를 처리하는 1조 매개변수 멀티모달 모델 V4를 이번 주 공개할 예정이며, 화웨이 칩에 최적화돼 미국 GPU 의존도를 낮춘 점이 주목된다.
DeepSeek V4 공개 — 1조 파라미터·100만 토큰 컨텍스트 오픈 웨이트 코딩 모델
중국 AI 스타트업 DeepSeek이 음력 설날인 2월 17일 V4를 공개했다. 1조 개 파라미터, 100만 토큰 컨텍스트, mHC 아키텍처를 갖춘 오픈 웨이트 모델로 코딩 벤치마크에서 Claude 3.5 Sonnet·GPT-4o를 능가한다고 주장한다.