grpo
标记 grpo 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 grpo 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 grpo 主题的项目。
近 90 天内还没有新项目标记这个主题。
- #1
使用 PEFT 或 Full-parameter 对 600+ LLM(Qwen3.6、DeepSeek-V4、GLM-5.1、InternLM3、Llama4、...)和 300+ MLLM(Qwen3-VL、Qwen3-Omni、InternVL3.5、Ovis2.5、GLM4.5v、Gemma4、Llava、Phi4、...)进行 CPT/SFT/DPO/GRPO(AAAI 2025)
★ 15,488+88近 7 天星标变化 - #2
全面开源的 AI 研究与工程技能库,适用于任何 AI 模型。将技能与您的 Claude / Codex / Gemini 代理打包,即可成为具备完整算力的 AI 研究代理。由 Orchestra Research 维护。
★ 12,256+104近 7 天星标变化 - #3
Agent Reinforcement Trainer:使用 GRPO 训练多步骤代理以执行真实任务。为您的代理提供在职培训。支持 Qwen3.6、GPT-OSS、Llama 等的强化学习
★ 10,689+10近 7 天星标变化 - #4
https://adongwanai.github.io/AgentGuide | AI Agent 开发指南 | LangGraph 实战 | 高级 RAG | 转行大模型 | 大模型面试 | 算法工程师 | 面试题库 | 强化学习|数据合成
★ 9,116+169近 7 天星标变化 - #5★ 6,018+4近 7 天星标变化
- #6
OpenClaw-RL:仅通过对话即可训练任何代理
★ 5,665+7近 7 天星标变化 - #7
从零开始在 PyTorch 中实现推理 LLM,逐步说明
★ 5,138+49近 7 天星标变化 - #8
🚀 一个开源、实作导向的课程,弥合基础 RL 概念与 LLM 对齐、RLVR 及进阶代理系统之间的差距
★ 4,199+54近 7 天星标变化 - #9
Skywork-R1V 是 Skywork AI 开发的先进多模态 AI 模型系列,专注于视觉-语言推理
★ 3,168+0近 7 天星标变化 - #10
verl-agent 是 veRL 的扩展,专为通过强化学习 (RL) 训练 LLM/VLM Agent 所设计。verl-agent 也是论文 "Group-in-Group Policy Optimization for LLM Agent Training" 的官方代码。
★ 2,274+17近 7 天星标变化 - #11★ 1,177+0近 7 天星标变化
- #12★ 1,060+2近 7 天星标变化
- #13★ 983+73近 7 天星标变化
- #14★ 669-1近 7 天星标变化
- #15★ 640+7近 7 天星标变化
- #16
RLAnything (ICML 2026) 与 AutoTool (ICML 2026),DemyAgent:用于 LLM 与 Agent 场景的开源强化学习
★ 634+11近 7 天星标变化 - #17
探索 2B 模型上的多模态“Aha 时刻”
★ 623+0近 7 天星标变化 - #18★ 597+12近 7 天星标变化
- #19
关于视频生成强化学习的精选论文列表。
★ 593+1近 7 天星标变化 - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 502—近 7 天星标变化 - #21
A systematic AI Agent development tutorial covering LLM agents, RAG, tool use, memory systems, multi-agent systems, LangChain, LangGraph, MCP, and agentic RL.|从零开始学 AI Agent 开发 | 系统、全面、实战导向的 Agent 开发教程 | 每日自动追踪 arXiv 最新论文 | Learn AI Agent Development from Scratch
★ 501—近 7 天星标变化