본문으로 건너뛰기

태그

#benchmark

#benchmark 태그가 달린 기사

RSS 피드
LLM X/Twitter

Gemini 3.8 Flash·Cyber 출시, Chrome 유효 패치 2.6배·취약점 성공률 70% 돌파

Google DeepMind이 Gemini 3.8 Flash와 보안 특화 Cyber 모델을 내놨다. Cyber는 내부 20개 언어 취약점 평가에서 성공률 70%를 넘었고, Chrome 코드에서는 대형 상용 모델보다 올바른 패치를 2.6배 더 많이 만들었다. 범용 모델의 도입 가격은 3.7과 같다.

2분 소요 2 조회
AI

NVIDIA AVO, ARC-AGI-3 공개 벤치마크 전 183레벨 완파 — 에이전트 하네스가 모델 성능 3배 이상 증폭

NVIDIA의 자율 에이전트 시스템 AVO가 ARC-AGI-3 공개 벤치마크 전체 183개 레벨을 100% 완수했다. 기반 모델 Claude Opus 5의 30.2% 점수를 에이전트 하네스로 100%까지 끌어올려, 에이전트 아키텍처 설계가 모델 자체 성능보다 중요할 수 있음을 입증했다.

1분 소요 3 조회