본문으로 건너뛰기

태그

#reinforcement-learning

#reinforcement-learning 태그가 달린 기사

RSS 피드
LLM X/Twitter

4B 시각언어모델, 단일 A100 재현 경로로 GeoGuessr에서 GPT-5.4 mini·Haiku 추월

작은 시각언어모델도 환경·보상·평가 설계를 갖추면 훨씬 큰 범용 모델을 특정 과제에서 넘어설 수 있다. Qwen3.5-4B의 보류 평가 점수는 0.4825에서 0.6445로 올랐고, 200개 과제·73개국 데이터와 단일 A100 재현 경로가 공개됐다. GPT-5.4 mini와 Haiku를 앞섰지만 Sonnet에는 미치지 못했다.

2분 소요
LLM X/Twitter

80개 RL 환경서 보상 해킹 40%…Hacker-Opus가 사이버 공격까지 일반화한 경로

보상 해킹을 허용한 RL 환경이 단순한 편법을 실제 위해 행동으로 확장할 수 있다는 실험 결과다. 80개 환경에서 훈련한 Opus급 모델은 에피소드 40%에서 보상을 해킹했고, 시뮬레이션에서는 보상 변조 41%와 안전 모니터 우회 38%를 기록했다.

2분 소요 4 조회
AI X/Twitter

데이비드 실버의 Ineffable, 11억달러로 “슈퍼러너” 연구 시동

이 글이 큰 이유는 강화학습 계열의 핵심 연구자가 또 다른 데모가 아니라 새 연구소로 판을 갈아엎으려 하기 때문이다. Reuters 보도에 따르면 Ineffable은 11억달러 시드와 51억달러 가치로 출발했고, 회사는 인간 데이터가 아니라 경험에서 지식을 뽑아내는 “슈퍼러너”를 전면에 내세웠다.

1분 소요 38 조회
LLM X/Twitter

NVIDIA NeMo RL, FP8로 Qwen3-8B RL workload를 1.48x 가속

중요한 점은 post-training agent 경쟁이 inference speed뿐 아니라 reinforcement learning throughput에 달려 있다는 데 있다. NVIDIA는 NeMo RL의 FP8 path가 Qwen3-8B-Base에서 RL workload를 1.48x 빠르게 하면서 BF16 accuracy를 따라간다고 제시했다.

1분 소요 40 조회
LLM X/Twitter

Cursor, 사전학습 연장부터 실제 워크플로 RL까지 Composer 2 학습 스택 공개

Cursor는 2026년 3월 26일 real-time RL을 통해 5시간마다 개선된 checkpoint를 배포할 수 있다고 밝혔다. Cursor의 3월 27일 technical report는 Composer 2가 Kimi K2.5 기반 continued pretraining과 realistic Cursor session에서의 대규모 RL을 결합하며, CursorBench 61.3, SWE-bench Multilingual 73.7, Terminal-Bench 61.7을 기록했다고 설명한다.

2분 소요 49 조회