LLM 해커뉴스
1M context 숫자보다 중요한 것, agent가 멍해지는 구간
HN 관심은 “큰 context window” 광고가 실제 작업 품질을 보장하지 않는다는 실무적 불신에 모였다.
1분 소요 37 조회
태그
#llm-evaluation 태그가 달린 기사
HN 관심은 “큰 context window” 광고가 실제 작업 품질을 보장하지 않는다는 실무적 불신에 모였다.
r/MachineLearning에서 다시 주목받은 arXiv 2603.01919는 GPT-5와 Gemini-2.5 접근을 내세우는 shadow API를 감사해 큰 성능 편차, 불안정한 safety 동작, 빈번한 model identity 실패를 보고했다.