LLM Jul 3, 2026 1 min read
agent改善は必ずしも新モデルやfine-tuningではない。Microsoft ResearchのSkillOptはGPT-5.5 direct chatの6 benchmark平均を58.8から82.3へ上げ、52評価セルすべてで最高または同率最高だった。
agent改善は必ずしも新モデルやfine-tuningではない。Microsoft ResearchのSkillOptはGPT-5.5 direct chatの6 benchmark平均を58.8から82.3へ上げ、52評価セルすべてで最高または同率最高だった。
Microsoft ResearchはMemoraを、保存内容と検索方法を分離するagent memory systemとして紹介した。研究blogではLoCoMoとLongMemEvalでMem0、RAG、full-context inferenceを上回り、context tokenを最大98%減らすとしている。
Microsoft Research、UC Berkeley、UCSF、Columbiaの研究チームはgenerative causal testingを示した。言語脳予測モデルを短い説明へ変換し、その説明を狙った物語をLLMに書かせてfMRIで検証する。