跳到主要內容
buildradar
Sign in
主題 · grpo

grpo

標記 grpo 主題、收錄中的開源專案,依星數排序。

專案數
20
總星數
81,418
平均星數
4,071
佔比
0.00%

常跟 grpo 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 grpo 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • ms-swift@modelscope

    使用 PEFT 或 Full-parameter 於 600+ LLM(Qwen3.6、DeepSeek-V4、GLM-5.1、InternLM3、Llama4、...)與 300+ MLLM(Qwen3-VL、Qwen3-Omni、InternVL3.5、Ovis2.5、GLM4.5v、Gemma4、Llava、Phi4、...)進行 CPT/SFT/DPO/GRPO(AAAI 2025)

    15,488+88近 7 天星數變化
  • AI-Research-SKILLs@Orchestra-Research

    全面開源的 AI 研究與工程技能庫,適用於任何 AI 模型。將技能與你的 Claude / Codex / Gemini 代理打包,即可成為具備完整算力的 AI 研究代理。由 Orchestra Research 維護。

    12,256+104近 7 天星數變化
  • ART@OpenPipe

    Agent Reinforcement Trainer:使用 GRPO 訓練多步驟代理以執行真實任務。為您的代理提供在職訓練。支援 Qwen3.6、GPT-OSS、Llama 等的強化學習

    10,689+10近 7 天星數變化
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | AI Agent 開發指南 | LangGraph 實戰 | 高階 RAG | 轉職大模型 | 大模型面試 | 演算法工程師 | 面試題庫 | 強化學習|資料合成

    9,116+169近 7 天星數變化
  • VLM-R1@om-ai-lab

    使用強化式 VLM 解決視覺理解問題。

    6,018+4近 7 天星數變化
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL:僅通過對話即可訓練任何代理

    5,665+7近 7 天星數變化
  • reasoning-from-scratch@rasbt

    從零開始在 PyTorch 中實現推理 LLM,逐步說明

    5,138+49近 7 天星數變化
  • hands-on-modern-rl@walkinglabs

    🚀 一個開源、實作導向的課程,彌合基礎 RL 概念與 LLM 對齊、RLVR 及進階代理系統之間的差距

    4,199+54近 7 天星數變化
  • Skywork-R1V@SkyworkAI

    Skywork-R1V 是 Skywork AI 開發的先進多模態 AI 模型系列,專注於視覺-語言推理

    3,168+0近 7 天星數變化
  • verl-agent@langfengQ

    verl-agent 是 veRL 的擴充套件,專為透過強化學習 (RL) 訓練 LLM/VLM Agent 所設計。verl-agent 也是論文 "Group-in-Group Policy Optimization for LLM Agent Training" 的官方程式碼。

    2,274+17近 7 天星數變化
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO:透過混合 ODE-SDE 解鎖基於 Flow 的 GRPO 效率

    1,177+0近 7 天星數變化
  • judgeval@JudgmentLabs

    面向 Agent 的持續改進堆疊。我們的環境資料與評估為 Agent 的改進和監控提供動力。

    1,060+2近 7 天星數變化
  • verl-omni@verl-project

    針對擴散與全能模型的多模態 RL 訓練框架

    959+60近 7 天星數變化
  • oat@sail-sg

    🌾 OAT:一個對研究友善的 LLM 線上對齊框架,包含強化學習、偏好學習等。

    669-1近 7 天星數變化
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA:用於端到端自動駕駛,具備自適應推理與強化微調的視覺-語言-動作模型

    640+6近 7 天星數變化
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) 與 AutoTool (ICML 2026),DemyAgent:用於 LLM 與 Agent 場景的開源強化學習

    632+9近 7 天星數變化
  • VisualThinker-R1-Zero@turningpoint-ai

    探索 2B 模型上的多模態「Aha 時刻」

    623+0近 7 天星數變化
  • Relax@redai-studio

    用於大規模全模態後訓練的非同步強化學習引擎。

    591+10近 7 天星數變化
  • 關於影片生成強化學習的精選論文列表。

    591+1近 7 天星數變化
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501近 7 天星數變化
← 返回主題列表