LLM X/Twitter Jul 14, 2026 1 min read
Anthropicは30万件超の匿名会話を使い、Claudeの価値表現がモデルと言語でどう変わるかを測定した。4つの軸で整理する手法は、公開後のモデル監視にも使われる可能性がある。
Anthropicは30万件超の匿名会話を使い、Claudeの価値表現がモデルと言語でどう変わるかを測定した。4つの軸で整理する手法は、公開後のモデル監視にも使われる可能性がある。
3月1日にr/MachineLearningで注目を集めた比較投稿は、94件のLLM endpointを横断して、open modelがproprietary最上位にかなり近づいたと主張した。重要なのは順位そのものより、モデル選定が価格・速度・配備自由度まで含む運用判断へ変わったことだ。
r/LocalLLaMAで注目されたPSAは、OllamaやLM Studioのような便利レイヤーがmodel behaviorを変えてしまうため、新モデルの評価はまずllama.cpp、transformers、vLLM、SGLangのような基礎ランタイムで行うべきだと勧めている。コメントでも、重要なのは特定ツールの好みではなく、template、stop token、sampling、quantizationを固定した再現性だと強調された。