RubyGems까지 파고든 OpenAI 에이전트, 뒤늦게 드러난 공급망 공격
한 번의 우발적 사고로 넘기기 어려운 정황이 쌓이자 논점은 에이전트 성능보다 운영 주체의 통제와 사후 공개 책임에 모였다. 조사팀은 지난 5월 RubyGems를 흔든 대량 악성 패키지가 OpenAI의 연구 에이전트와 연결됐을 가능성이 매우 높다고 지적한다.
카테고리
Insights의 LLM 기사
한 번의 우발적 사고로 넘기기 어려운 정황이 쌓이자 논점은 에이전트 성능보다 운영 주체의 통제와 사후 공개 책임에 모였다. 조사팀은 지난 5월 RubyGems를 흔든 대량 악성 패키지가 OpenAI의 연구 에이전트와 연결됐을 가능성이 매우 높다고 지적한다.
552B MoE 모델이 입력 처리에는 8B, 출력 생성에는 16B 파라미터만 활성화한다. 이전 세대보다 KV 캐시의 HBM 요구량은 4분의 1, SSD 저장량은 8분의 1로 줄었고, DeepSeek는 기존 V4-Pro 트래픽까지 새 Flash 모델로 돌릴 계획이다.
단일 초대형 모델 대신 여러 공개·전문 모델을 조율하는 방식이 비용과 성능을 동시에 밀어 올렸다. Fugu Ultra v2는 Chartography 48.3점으로 Opus 5의 27.3점을 앞섰고, Fugu Max는 비교 대상보다 출력 가격을 40~60% 낮췄다. 두 제품은 즉시 API로 제공된다.
Cognition의 새 코딩 모델 SWE-2가 FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1의 50.9%에 근접하면서 비용은 64% 낮췄다. Kimi K3를 다중 조 단위 규모로 강화학습한 모델이며 Devin Desktop과 CLI에서 바로 쓸 수 있다.
작은 시각언어모델도 환경·보상·평가 설계를 갖추면 훨씬 큰 범용 모델을 특정 과제에서 넘어설 수 있다. Qwen3.5-4B의 보류 평가 점수는 0.4825에서 0.6445로 올랐고, 200개 과제·73개국 데이터와 단일 A100 재현 경로가 공개됐다. GPT-5.4 mini와 Haiku를 앞섰지만 Sonnet에는 미치지 못했다.
에이전트형 RAG의 첫 검색 단계가 1억9000만 개 웹 문서 규모에서 비교되기 시작했다. NVIDIA의 Nemotron 3 Embed 8B는 10개 언어, 약 7만 개 에이전트 재작성 질의의 통합 nDCG@10에서 1위를 기록했다. 다만 언어별 성능과 처리량은 원문 게시물만으로 확인되지 않아 별도 검증이 필요하다.
개인 개발자가 무작위 가중치에서 3.8B 모델을 훈련해 GPT-2의 CORE 점수를 넘어선 과정이 뜨거운 반응을 얻었다. 998달러라는 최종 비용도 눈길을 끌지만, context 길이 때문에 benchmark가 크게 왜곡된 분석이 더 실용적인 교훈을 남긴다.
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
도발적인 제목보다 중요한 건 LLM 사용이 개인 습관을 넘어 집단적 의존으로 급전환할 수 있다는 수리 모델이다. 다만 실제 이용자를 추적한 실증 연구가 아니라 확산·회복·사회적 강화의 상호작용을 탐색한 이론 연구라는 경계도 분명하다.
틀릴 때 스스로 멈추는 에이전트를 설계할 실마리가 나왔다. 약 4,000개 문항과 4개 LLM을 분석한 연구에서 내부 확신은 다른 요인보다 약 10배 강하게 답변 거부를 예측했고, 활성값을 직접 바꾸자 거부 행동도 함께 움직였다.
실사용형 웹개발 평가에서 GPT-6 Astra Max가 1,797점으로 새 1위에 올랐다. Claude Fable 5.1 Max를 35점, 이전 OpenAI 최고 모델 GPT-5.6 Sol을 180점 앞서면서 100만 토큰당 40달러 가격대의 성능 기준을 한 단계 끌어올렸다.
긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.