grpo
grpo がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
grpo と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、grpo がタグ付けされたリポジトリ。
直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。
- #1
PEFTまたはFull-parameterを使用して、600以上のLLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) および300以上のMLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) に適用する (AAAI 2025)。
★ 15,488+116直近 7 日のスター増減 - #2
あらゆるAIモデルに対応した、包括的なAI研究およびエンジニアリングスキルを提供するオープンソースライブラリ。このスキルをパッケージ化することで、あなたのclaude code/codex/geminiエージェントはフルパワーのAI研究エージェントになります。Orchestra Researchによってメンテナンスされています。
★ 12,256+176直近 7 日のスター増減 - #3
Agent Reinforcement Trainer: GRPOを用いた実世界タスク向けマルチステップエージェントの訓練。エージェントに現場トレーニングを提供。Qwen3.6、GPT-OSS、Llamaなどに対応した強化学習!
★ 10,689+24直近 7 日のスター増減 - #4
https://adongwanai.github.io/AgentGuide | AI Agent開発ガイド | LangGraph実践 | 高度RAG | キャリアチェンジLLM | LLM面接 | アルゴリズムエンジニア | 面接問題集 | 強化学習|データ合成
★ 9,116+273直近 7 日のスター増減 - #5★ 6,018+3直近 7 日のスター増減
- #6
OpenClaw-RL: 話すだけで任意のエージェントを訓練
★ 5,665+10直近 7 日のスター増減 - #7
PyTorchで推論LLMをゼロから、ステップバイステップで実装。
★ 5,138+67直近 7 日のスター増減 - #8
🚀 基本的なRLの概念からLLMアライメント、RLVR、高度なエージェンティックシステムへのギャップを埋めるオープンソースの実践的カリキュラム
★ 4,199+69直近 7 日のスター増減 - #9
Skywork-R1V は Skywork AI が開発した高度なマルチモーダル AI モデルシリーズで、視覚と言語の推論を専門としています。
★ 3,168+1直近 7 日のスター増減 - #10
verl-agentはveRLの拡張であり、RLを介してLLM/VLMエージェントを訓練するために設計されています。また、論文「Group-in-Group Policy Optimization for LLM Agent Training」の公式コードでもあります。
★ 2,274+18直近 7 日のスター増減 - #11★ 1,177+0直近 7 日のスター増減
- #12★ 1,060+1直近 7 日のスター増減
- #13★ 955+56直近 7 日のスター増減
- #14★ 669-1直近 7 日のスター増減
- #15
[NeurIPS 2025] AutoVLA:適応的推論と強化学習によるファインチューニングを備えた、エンドツーエンド自動運転のためのVision-Language-Actionモデル
★ 640+5直近 7 日のスター増減 - #16
RLAnything (ICML 2026) & AutoTool (ICML 2026)、DemyAgent: LLM およびエージェントシナリオ向けのオープンソース RL
★ 632+7直近 7 日のスター増減 - #17
2B Modelにおけるマルチモーダルな「アハ体験」を探求
★ 623+0直近 7 日のスター増減 - #18
動画生成における強化学習に関する論文のキュレーションリスト
★ 591+2直近 7 日のスター増減 - #19★ 590+7直近 7 日のスター増減
- #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—直近 7 日のスター増減