LLM X/Twitter
GPT-6 Astra, FrontierMath 98%·ARC-AGI-3 99.9%로 추론 한계선 재설정
GPT-6 Astra가 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%를 기록하며 수학·추론·사이버 역량의 기준선을 동시에 끌어올렸다. 다만 OpenAI 자체 평가가 포함된 만큼 독립 재현과 실제 제품 환경의 안전성 검증이 다음 관문이다.
2분 소요