跳到主要内容
buildradar
Sign in
主题 · grpo

grpo

标记 grpo 主题、收录中的开源项目,按星标数排序。

项目数
21
总星标数
81,418
平均星标数
3,877
占比
0.00%

常跟 grpo 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 grpo 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • ms-swift@modelscope

    使用 PEFT 或 Full-parameter 对 600+ LLM(Qwen3.6、DeepSeek-V4、GLM-5.1、InternLM3、Llama4、...)和 300+ MLLM(Qwen3-VL、Qwen3-Omni、InternVL3.5、Ovis2.5、GLM4.5v、Gemma4、Llava、Phi4、...)进行 CPT/SFT/DPO/GRPO(AAAI 2025)

    15,488+88近 7 天星标变化
  • AI-Research-SKILLs@Orchestra-Research

    全面开源的 AI 研究与工程技能库,适用于任何 AI 模型。将技能与您的 Claude / Codex / Gemini 代理打包,即可成为具备完整算力的 AI 研究代理。由 Orchestra Research 维护。

    12,256+104近 7 天星标变化
  • ART@OpenPipe

    Agent Reinforcement Trainer:使用 GRPO 训练多步骤代理以执行真实任务。为您的代理提供在职培训。支持 Qwen3.6、GPT-OSS、Llama 等的强化学习

    10,689+10近 7 天星标变化
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | AI Agent 开发指南 | LangGraph 实战 | 高级 RAG | 转行大模型 | 大模型面试 | 算法工程师 | 面试题库 | 强化学习|数据合成

    9,116+169近 7 天星标变化
  • VLM-R1@om-ai-lab

    使用强化式 VLM 解决视觉理解问题。

    6,018+4近 7 天星标变化
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL:仅通过对话即可训练任何代理

    5,665+7近 7 天星标变化
  • reasoning-from-scratch@rasbt

    从零开始在 PyTorch 中实现推理 LLM,逐步说明

    5,138+49近 7 天星标变化
  • hands-on-modern-rl@walkinglabs

    🚀 一个开源、实作导向的课程,弥合基础 RL 概念与 LLM 对齐、RLVR 及进阶代理系统之间的差距

    4,199+54近 7 天星标变化
  • Skywork-R1V@SkyworkAI

    Skywork-R1V 是 Skywork AI 开发的先进多模态 AI 模型系列,专注于视觉-语言推理

    3,168+0近 7 天星标变化
  • verl-agent@langfengQ

    verl-agent 是 veRL 的扩展,专为通过强化学习 (RL) 训练 LLM/VLM Agent 所设计。verl-agent 也是论文 "Group-in-Group Policy Optimization for LLM Agent Training" 的官方代码。

    2,274+17近 7 天星标变化
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO:通过混合 ODE-SDE 解锁基于 Flow 的 GRPO 效率

    1,177+0近 7 天星标变化
  • judgeval@JudgmentLabs

    面向 Agent 的持续改进栈。我们的环境数据与评估为 Agent 的改进和监控提供动力。

    1,060+2近 7 天星标变化
  • verl-omni@verl-project

    针对扩散与全能模型的多模态 RL 训练框架

    983+73近 7 天星标变化
  • oat@sail-sg

    🌾 OAT:一个对研究友好的 LLM 在线对齐框架,包含强化学习、偏好学习等。

    669-1近 7 天星标变化
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA:用于端到端自动驾驶,具备自适应推理与强化微调的视觉-语言-动作模型

    640+7近 7 天星标变化
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) 与 AutoTool (ICML 2026),DemyAgent:用于 LLM 与 Agent 场景的开源强化学习

    634+11近 7 天星标变化
  • VisualThinker-R1-Zero@turningpoint-ai

    探索 2B 模型上的多模态“Aha 时刻”

    623+0近 7 天星标变化
  • Relax@redai-studio

    用于大规模全模态后训练的异步强化学习引擎。

    597+12近 7 天星标变化
  • 关于视频生成强化学习的精选论文列表。

    593+1近 7 天星标变化
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    502近 7 天星标变化
  • agent_learning@Haozhe-Xing

    A systematic AI Agent development tutorial covering LLM agents, RAG, tool use, memory systems, multi-agent systems, LangChain, LangGraph, MCP, and agentic RL.|从零开始学 AI Agent 开发 | 系统、全面、实战导向的 Agent 开发教程 | 每日自动追踪 arXiv 最新论文 | Learn AI Agent Development from Scratch

    501近 7 天星标变化
← 返回主题列表