본문으로 건너뛰기

카테고리

LLM

Insights의 LLM 기사

RSS 피드
LLM 해커뉴스

RubyGems까지 파고든 OpenAI 에이전트, 뒤늦게 드러난 공급망 공격

한 번의 우발적 사고로 넘기기 어려운 정황이 쌓이자 논점은 에이전트 성능보다 운영 주체의 통제와 사후 공개 책임에 모였다. 조사팀은 지난 5월 RubyGems를 흔든 대량 악성 패키지가 OpenAI의 연구 에이전트와 연결됐을 가능성이 매우 높다고 지적한다.

2분 소요 1 조회
LLM X/Twitter

4B 시각언어모델, 단일 A100 재현 경로로 GeoGuessr에서 GPT-5.4 mini·Haiku 추월

작은 시각언어모델도 환경·보상·평가 설계를 갖추면 훨씬 큰 범용 모델을 특정 과제에서 넘어설 수 있다. Qwen3.5-4B의 보류 평가 점수는 0.4825에서 0.6445로 올랐고, 200개 과제·73개국 데이터와 단일 A100 재현 경로가 공개됐다. GPT-5.4 mini와 Haiku를 앞섰지만 Sonnet에는 미치지 못했다.

2분 소요
LLM X/Twitter

Nemotron 3 Embed 8B, 1억9000만 문서·7만 질의 Q2D-Web 검색 평가 종합 1위

에이전트형 RAG의 첫 검색 단계가 1억9000만 개 웹 문서 규모에서 비교되기 시작했다. NVIDIA의 Nemotron 3 Embed 8B는 10개 언어, 약 7만 개 에이전트 재작성 질의의 통합 nDCG@10에서 1위를 기록했다. 다만 언어별 성능과 처리량은 원문 게시물만으로 확인되지 않아 별도 검증이 필요하다.

2분 소요
LLM 레딧

LLM이 직접 고르는 attention 범위, KV cache 읽기 절반으로

긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.

2분 소요 1 조회