LLM X/Twitter Jun 17, 2026 1 min read
모델 안전성 검토가 손으로 만든 테스트를 넘어 출시 전 위험률 예측으로 이동하고 있다. OpenAI는 약 130만 건의 비식별 대화를 활용했고, GPT-5 계열에서 중앙값 1.5배 오차를 보고했다.
모델 안전성 검토가 손으로 만든 테스트를 넘어 출시 전 위험률 예측으로 이동하고 있다. OpenAI는 약 130만 건의 비식별 대화를 활용했고, GPT-5 계열에서 중앙값 1.5배 오차를 보고했다.
Anthropic이 2026년 2월 18일 Claude Opus 4.6과 Sonnet 4.6을 발표했다. 두 모델은 즉시 응답과 extended thinking을 모두 지원하는 하이브리드 구조를 유지하면서, 코딩 신뢰성과 장기 추론 안정성을 개선했다.