OpenAI, First Proof 제출물 공개... 연구급 수학 문제 10개 전부에 proof attempt 제시
OpenAI는 2026년 2월 20일 First Proof의 연구급 수학 문제 10개 전부에 대한 proof attempt를 공개했다고 밝혔다. 회사는 외부 expert feedback 이후 최소 5개 시도가 정답일 가능성이 높다고 보고 있지만, 일부는 아직 검토 중이며 problem 2 시도는 잘못됐다고 판단했다.
태그
#reasoning 태그가 달린 기사
OpenAI는 2026년 2월 20일 First Proof의 연구급 수학 문제 10개 전부에 대한 proof attempt를 공개했다고 밝혔다. 회사는 외부 expert feedback 이후 최소 5개 시도가 정답일 가능성이 높다고 보고 있지만, 일부는 아직 검토 중이며 problem 2 시도는 잘못됐다고 판단했다.
OpenAI는 2026년 3월 5일 X에서 GPT-5.4 Thinking의 Chain-of-Thought controllability가 낮다고 밝혔다. 이는 현재 기준으로 CoT monitoring이 여전히 유효한 안전 장치일 수 있다는 메시지와 함께 공개됐다.
2026년 3월 9일 제출된 arXiv 논문 Ares는 multi-step LLM agent에서 단계별 reasoning effort를 동적으로 조절하는 방식을 제안했다. 저자들은 fixed high-effort 대비 reasoning token 사용량을 최대 52.7% 줄이면서 성공률 저하는 작았다고 보고했다.
새로운 llama.cpp 변경은 <code>--reasoning-budget</code>를 template stub이 아니라 sampler 차원의 실제 제어로 바꾼다. LocalLLaMA thread는 긴 think loop를 줄이는 것과 answer quality를 지키는 것 사이의 tradeoff, 특히 local Qwen 3.5 환경에서의 의미를 집중적으로 논의했다.
Hacker News에서 주목받은 Sarvam AI의 발표는 IndiaAI mission 기반으로 인도에서 학습한 reasoning 중심 MoE 모델 Sarvam 30B와 105B를 오픈소스로 공개했다는 점에 있다. 공개 범위가 단순한 weights를 넘어 제품 배치, inference 최적화, Indian-language benchmark 성과까지 포함한다는 점이 핵심이다.
Google AI Developers가 Gemini API를 통해 Gemini 3.1 Flash-Lite 프리뷰를 공개했다. 게시물에 따르면 이 모델은 Gemini 3 계열 중 가장 빠르고 비용 효율적인 옵션이며, 작업 난이도에 맞춰 추론을 조절하는 dynamic thinking을 지원한다.
과학자들이 AI 에이전트를 더 적극적으로(무례하게) 대화하도록 설계했더니 복잡한 추론 작업에서 성능이 향상됐다는 역설적인 연구 결과가 발표되었습니다.
Google DeepMind는 2026년 2월 19일 Gemini 3.1 Pro를 발표했다. 회사는 ARC-AGI-2에서 77.1% 검증 점수를 제시하며, 개발자·기업·일반 사용자 채널에 동시 롤아웃한다고 밝혔다.
Opper가 53개 주요 LLM을 대상으로 "Car Wash" 논리 테스트를 실시했다. "세차장이 50미터 앞에 있는데 걸어갈까, 운전해 갈까?"라는 단순한 질문에 단 11개 모델만 정답을 맞혔다.
Google이 Gemini 3.1 Pro를 출시하며 ARC-AGI-2 벤치마크에서 77.1%를 기록했다. 이전 모델 대비 추론 성능이 2배 이상 향상되었으며, 복잡한 문제 해결을 위한 고급 추론 기능이 개발자와 일반 사용자에게 폭넓게 제공된다.
Google DeepMind가 Gemini 3.1 Pro를 출시했다. 전작 대비 추론 성능이 2배 이상 향상됐으며 ARC-AGI-2에서 77.1%를 달성했다. 18개 추적 벤치마크 중 12개에서 1위를 기록하면서 API 가격은 $2/$12로 그대로 유지된다.
Hacker News에서 높은 관심을 받은 Gemini 3.1 Pro 출시 소식. Google은 개발자·기업·일반 사용자 채널 전반에 Preview를 확장하며, ARC-AGI-2 점수 77.1%를 강조했다.