メインコンテンツへスキップ
buildradar
Sign in

langfengQ/verl-agent

@langfengQ

verl-agentはveRLの拡張であり、RLを介してLLM/VLMエージェントを訓練するために設計されています。また、論文「Group-in-Group Policy Optimization for LLM Agent Training」の公式コードでもあります。

スター
2,274
フォーク
219
言語
Python
ライセンス
Apache-2.0
最終プッシュ
3 か月前
Pythonagent-frameworkllm-agentslarge-language-modelsreinforcement-learningdeepseek-r1grpollm-traininggigpo

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。