prime-rl 0.9.0 — vLLM圧力からRLの同時実行数を適応制御
これは何?agentic task向けのSFT、reinforcement learning、evaluationをNVIDIA GPU clusterで実行するApache-2.0 frameworkです。
継続開発中の0.9.0は、vLLMのqueueとKV-cache圧力からin-flight episode数を増減し、overload時は新しいworkをcancelするadaptive concurrencyを追加しました。local dashboard、SFT中のagentic eval、full CPU optimizer offload、Blackwell向け任意kernelも加わりましたが、vLLM・monitor・checkpoint・run directory設定に広いbreaking changeがあり、少なくともNVIDIA GPUが1枚必要です。
固定の並列度ではなくinference serverの実測負荷からrollout量を制御し、KV-cache thrashを避けながらGPU利用率を上げられます。0.8系からはconfigとartifact contractが大きく変わるため、段階的migrationとresume検証が必要です。
- 読むべき人
- LLM post-training基盤開発者、RL researcher、GPU cluster運用者
- GitHub
- 2000 stars / 418 forks