LLM 2h ago 1 min read TPU待ち時間を削るGoogle Tunix、agentic RLの訓練基盤へ agentic RLの訓練では、モデル計算よりtool実行や環境step待ちでacceleratorが空く問題が重くなる。Google Tunixはasynchronous rolloutとproducer-consumer pipelineで、JAX/TPU上のmulti-turn agent訓練を詰まりにくくする。 #google#tunix#agentic-rl 1