LLM X/Twitter Apr 28, 2026 1 min read
重要なのは、FP8推論が品質崩壊を直せてこそ意味を持つことだ。vLLMは two-level accumulation の変更で、128k needle-in-a-haystack の精度を13%から89%まで戻しつつ、FP8 decode の速度優位を保ったと書いた。
重要なのは、FP8推論が品質崩壊を直せてこそ意味を持つことだ。vLLMは two-level accumulation の変更で、128k needle-in-a-haystack の精度を13%から89%まで戻しつつ、FP8 decode の速度優位を保ったと書いた。
重要なのは、post-training agentsの競争がinference speedだけでなくreinforcement learning throughputにも左右されることだ。NVIDIAは、NeMo RLのFP8 pathがQwen3-8B-BaseでRL workloadsを1.48x高速化し、BF16 accuracyに沿うと示した。