본문으로 건너뛰기

Insights

기사

기사 102개

LLM X/Twitter

4B 시각언어모델, 단일 A100 재현 경로로 GeoGuessr에서 GPT-5.4 mini·Haiku 추월

작은 시각언어모델도 환경·보상·평가 설계를 갖추면 훨씬 큰 범용 모델을 특정 과제에서 넘어설 수 있다. Qwen3.5-4B의 보류 평가 점수는 0.4825에서 0.6445로 올랐고, 200개 과제·73개국 데이터와 단일 A100 재현 경로가 공개됐다. GPT-5.4 mini와 Haiku를 앞섰지만 Sonnet에는 미치지 못했다.

2분 소요 1 조회
LLM X/Twitter

Nemotron 3 Embed 8B, 1억9000만 문서·7만 질의 Q2D-Web 검색 평가 종합 1위

에이전트형 RAG의 첫 검색 단계가 1억9000만 개 웹 문서 규모에서 비교되기 시작했다. NVIDIA의 Nemotron 3 Embed 8B는 10개 언어, 약 7만 개 에이전트 재작성 질의의 통합 nDCG@10에서 1위를 기록했다. 다만 언어별 성능과 처리량은 원문 게시물만으로 확인되지 않아 별도 검증이 필요하다.

2분 소요 1 조회
LLM X/Twitter

Gemini 3.8 Flash·Cyber 출시, Chrome 유효 패치 2.6배·취약점 성공률 70% 돌파

Google DeepMind이 Gemini 3.8 Flash와 보안 특화 Cyber 모델을 내놨다. Cyber는 내부 20개 언어 취약점 평가에서 성공률 70%를 넘었고, Chrome 코드에서는 대형 상용 모델보다 올바른 패치를 2.6배 더 많이 만들었다. 범용 모델의 도입 가격은 3.7과 같다.

2분 소요 2 조회