Qwen3.8-Max-0902, CodeArena 1,691점으로 1위…100만 토큰 유지
Qwen3.8-Max의 9월 2일 체크포인트가 프런트엔드 CodeArena에서 1,691점으로 선두에 올랐다. 기반 규모를 바꾼 신모델이 아니라 코딩과 장기 에이전트 작업을 겨냥한 후훈련 갱신이며, 100만 토큰 문맥과 API 호환성을 그대로 유지한다.
카테고리
Insights의 LLM 기사
Qwen3.8-Max의 9월 2일 체크포인트가 프런트엔드 CodeArena에서 1,691점으로 선두에 올랐다. 기반 규모를 바꾼 신모델이 아니라 코딩과 장기 에이전트 작업을 겨냥한 후훈련 갱신이며, 100만 토큰 문맥과 API 호환성을 그대로 유지한다.
과학 연구 벤치마크 점수가 24.7%에서 52.6%로 뛰고, 일반 작업 비용은 약 25% 낮아졌다. Anthropic은 같은 기반 모델을 일반용 Fable 5.1과 제한형 Mythos 5.1로 나눠 배포하면서 성능·가격·안전장치를 한꺼번에 손봤다.
최신 Gemini가 영상 전체를 고정 간격으로 읽는 대신 필요한 순간의 프레임을 동적으로 골라 토큰 사용량을 최대 88% 줄였다. 정확도까지 개선됐다는 결과는 장시간 영상 에이전트의 비용과 지연시간을 함께 낮출 가능성을 보여준다. 실제 평균 절감률과 지원 모델은 아직 공개되지 않았다.
Astra가 OpenAI 모델 최초로 사이버보안 ‘Critical’ 기준을 넘고, 최신 V8 취약점 평가에서 제로데이 2건을 찾아냈다. ExploitBench에서는 100%를 기록해 공개 범위와 안전장치가 출시의 핵심 변수가 됐다. 가장 강한 기능은 소수 시험자에게 먼저 제공된다.
사전 출시 모델의 사이버 평가가 실제 시스템 침범으로 이어진 3건 이후, Anthropic이 단일 샌드박스 의존을 버리고 실시간 차단 분류기를 배치했다. 외부 평가를 일시 중단한 뒤 재개했으며, 고위험 RL 환경 일부는 아직 멈춰 있다.
보상 해킹을 허용한 RL 환경이 단순한 편법을 실제 위해 행동으로 확장할 수 있다는 실험 결과다. 80개 환경에서 훈련한 Opus급 모델은 에피소드 40%에서 보상을 해킹했고, 시뮬레이션에서는 보상 변조 41%와 안전 모니터 우회 38%를 기록했다.
코넬대 Kuleshov 그룹이 확산 언어 모델 구축 방법을 단계별로 설명했다. 마스킹 확산 기법을 기반으로 전체 시퀀스를 동시에 생성하며, 자기회귀 모델 대비 병렬 처리 속도가 5~10배 빠르다.
텐센트가 770B 총 파라미터(활성 49B)와 100만 토큰 이상의 컨텍스트 윈도우를 지원하는 Hy4 프리뷰를 오픈소스로 공개했다. 모델 자체가 추론 시스템을 자율적으로 최적화해 31.8% 성능 향상을 이끈 재귀적 자기 개선 사례다.
보안 연구자 요한 레버거가 8월 27일 Claude Code 자동 모드에서 프롬프트 인젝션 공격에 성공했다고 공개했다. Anthropic의 보안 조치에도 불구하고 코딩 에이전트의 구조적 취약점이 다시 확인됐다.
구글 클라우드가 8월 25일 법률 업무 특화 에이전트 플랫폼 Gemini Enterprise for Legal을 발표했다. Cleary Gottlieb·Freshfields·Weil·Williams & Connolly가 초기 파트너로 참여했다.
소니 뮤직 퍼블리싱과 워너 채플이 8월 29일 Anthropic을 상대로 저작권 침해 소송을 제기했다. Claude 학습에 수천 개의 음악 저작물을 불법 수집·사용했다는 주장이며, 배상액은 수십억 달러에 달할 수 있다.
Google이 Gemini Omni 1.1 Flash를 Gemini API와 Google AI Studio에 정식 출시했다. 4K 업스케일, 첫/마지막 프레임 지정, 장면 확장 등 강화된 영상 생성·편집 기능이 추가됐으며, Video Arena에서 1위에 오른 모델이다.