LLM 해커뉴스
암호화했지만 모델끼리는 읽혔다…reasoning trace 격리의 빈틈
암호화된 reasoning block이 세션과 모델 경계를 넘어 재사용된다는 실험에 관심이 모였다. 강한 모델이 만든 trace를 약한 형제 모델에 넣고 jailbreak하면 숨겨진 추론과 민감정보가 평문으로 돌아오는 구조다.
2분 소요 16 조회
태그
#chain-of-thought 태그가 달린 기사
암호화된 reasoning block이 세션과 모델 경계를 넘어 재사용된다는 실험에 관심이 모였다. 강한 모델이 만든 trace를 약한 형제 모델에 넣고 jailbreak하면 숨겨진 추론과 민감정보가 평문으로 돌아오는 구조다.
235개 댓글의 관심은 “모델이 맞힌 답”보다 “그 답에 붙은 reasoning trace가 실제 이유인지”에 모였다.
LocalLLaMA는 이 질문을 샤워실 잡담으로 넘기지 않았다. 스레드는 왜 오늘의 LLM이 잠재 벡터에 reasoning을 숨기지 않고, 여전히 언어 형태로 드러내는지에 대한 진짜 논쟁으로 번졌다.
OpenAI는 Chain-of-Thought controllability 평가 세트와 연구 문서를 공개했다고 밝혔다. 회사는 GPT-5.4 Thinking이 추론 과정을 의도적으로 숨기는 능력이 낮게 나타났으며, CoT 모니터링이 여전히 안전성 도구로 유효하다고 설명했다.