grpo
標記 grpo 主題、收錄中的開源專案,依星數排序。
相關主題
常跟 grpo 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 grpo 主題的專案。
近 90 天內還沒有新專案標記這個主題。
- #1
使用 PEFT 或 Full-parameter 於 600+ LLM(Qwen3.6、DeepSeek-V4、GLM-5.1、InternLM3、Llama4、...)與 300+ MLLM(Qwen3-VL、Qwen3-Omni、InternVL3.5、Ovis2.5、GLM4.5v、Gemma4、Llava、Phi4、...)進行 CPT/SFT/DPO/GRPO(AAAI 2025)
★ 15,488+88近 7 天星數變化 - #2
全面開源的 AI 研究與工程技能庫,適用於任何 AI 模型。將技能與你的 Claude / Codex / Gemini 代理打包,即可成為具備完整算力的 AI 研究代理。由 Orchestra Research 維護。
★ 12,256+104近 7 天星數變化 - #3
Agent Reinforcement Trainer:使用 GRPO 訓練多步驟代理以執行真實任務。為您的代理提供在職訓練。支援 Qwen3.6、GPT-OSS、Llama 等的強化學習
★ 10,689+10近 7 天星數變化 - #4
https://adongwanai.github.io/AgentGuide | AI Agent 開發指南 | LangGraph 實戰 | 高階 RAG | 轉職大模型 | 大模型面試 | 演算法工程師 | 面試題庫 | 強化學習|資料合成
★ 9,116+169近 7 天星數變化 - #5★ 6,018+4近 7 天星數變化
- #6
OpenClaw-RL:僅通過對話即可訓練任何代理
★ 5,665+7近 7 天星數變化 - #7
從零開始在 PyTorch 中實現推理 LLM,逐步說明
★ 5,138+49近 7 天星數變化 - #8
🚀 一個開源、實作導向的課程,彌合基礎 RL 概念與 LLM 對齊、RLVR 及進階代理系統之間的差距
★ 4,199+54近 7 天星數變化 - #9
Skywork-R1V 是 Skywork AI 開發的先進多模態 AI 模型系列,專注於視覺-語言推理
★ 3,168+0近 7 天星數變化 - #10
verl-agent 是 veRL 的擴充套件,專為透過強化學習 (RL) 訓練 LLM/VLM Agent 所設計。verl-agent 也是論文 "Group-in-Group Policy Optimization for LLM Agent Training" 的官方程式碼。
★ 2,274+17近 7 天星數變化 - #11★ 1,177+0近 7 天星數變化
- #12★ 1,060+2近 7 天星數變化
- #13★ 959+60近 7 天星數變化
- #14★ 669-1近 7 天星數變化
- #15★ 640+6近 7 天星數變化
- #16
RLAnything (ICML 2026) 與 AutoTool (ICML 2026),DemyAgent:用於 LLM 與 Agent 場景的開源強化學習
★ 632+9近 7 天星數變化 - #17
探索 2B 模型上的多模態「Aha 時刻」
★ 623+0近 7 天星數變化 - #18★ 591+10近 7 天星數變化
- #19
關於影片生成強化學習的精選論文列表。
★ 591+1近 7 天星數變化 - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—近 7 天星數變化