OpenPipe/ART
@OpenPipeAgent Reinforcement Trainer: GRPOを用いた実世界タスク向けマルチステップエージェントの訓練。エージェントに現場トレーニングを提供。Qwen3.6、GPT-OSS、Llamaなどに対応した強化学習!
スター
10,679
フォーク
982
言語
Python
ライセンス
Apache-2.0
最終プッシュ
3 日前
関連 Intel(0)
関連 Intel はまだありません
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。