LLM Jul 3, 2026 1 min read
agent 성능 개선이 항상 새 모델이나 fine-tuning을 뜻하지는 않는다. Microsoft Research의 SkillOpt는 GPT-5.5 direct chat 6개 benchmark 평균을 58.8에서 82.3으로 올렸고, 52개 평가 셀에서 최고 또는 공동 최고를 기록했다.
agent 성능 개선이 항상 새 모델이나 fine-tuning을 뜻하지는 않는다. Microsoft Research의 SkillOpt는 GPT-5.5 direct chat 6개 benchmark 평균을 58.8에서 82.3으로 올렸고, 52개 평가 셀에서 최고 또는 공동 최고를 기록했다.
Microsoft Research가 Memora를 저장 내용과 검색 방식을 분리한 에이전트 기억 시스템으로 소개했다. 연구 블로그는 LoCoMo와 LongMemEval에서 Mem0, RAG, full-context inference를 앞서며 컨텍스트 토큰을 최대 98% 줄였다고 설명한다.
Microsoft Research와 UC Berkeley, UCSF, Columbia 연구진은 generative causal testing으로 언어 예측 모델을 짧은 설명으로 바꾸고 fMRI에서 검증했다. food preparation, location names 같은 설명이 실제 피질 반응으로 확인됐다.