LLM 4d ago 1 min read
agentic RLの訓練では、モデル計算よりtool実行や環境step待ちでacceleratorが空く問題が重くなる。Google Tunixはasynchronous rolloutとproducer-consumer pipelineで、JAX/TPU上のmulti-turn agent訓練を詰まりにくくする。
agentic RLの訓練では、モデル計算よりtool実行や環境step待ちでacceleratorが空く問題が重くなる。Google Tunixはasynchronous rolloutとproducer-consumer pipelineで、JAX/TPU上のmulti-turn agent訓練を詰まりにくくする。
r/singularityでByteDance SeedとTsinghua AIRによるCUDA Agentが注目された。torch.compile比で高いpass rateとspeedupを示し、GPU kernel最適化の自動化可能性を示唆している。