跳到主要内容
buildradar
登录
主题 · rlhf

rlhf

标记 rlhf 主题、收录中的开源项目,按星标数排序。

共 45 个项目
  • HALOs@ContextualAI

    一个具有 DPO、KTO、PPO、ORPO 及其他人类意识损失函数(HALO)可扩展实现的库。

    909-1近 7 天星标变化
  • OpenJudge@agentscope-ai

    OpenJudge:用于全面评估与质量奖励的统一框架

    828+15近 7 天星标变化
  • 大语言模型策略内蒸馏(OPD)的精选论文、技术报告、框架与工具集合

    812+32近 7 天星标变化
  • Aligning Large Language Models with Human: A Survey

    738近 7 天星标变化
  • reward-bench@allenai

    RewardBench:奖励模型的第一个评估工具。

    735+0近 7 天星标变化
  • Trinity-RFT@agentscope-ai

    Trinity-RFT 是一个通用的、灵活且具备可扩展性的框架,专为大型语言模型 (LLM) 的强化微调 (RFT) 而设计。

    700+2近 7 天星标变化
  • oat@sail-sg

    🌾 OAT:一个对研究友好的 LLM 在线对齐框架,包含强化学习、偏好学习等。

    669+0近 7 天星标变化
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) 与 AutoTool (ICML 2026),DemyAgent:用于 LLM 与 Agent 场景的开源强化学习

    635+4近 7 天星标变化
  • LLamaTuner@jianzhnie

    简单且高效的 LLM 微调工具(支持 LLaMA、LLaMA2、LLaMA3、Qwen、Baichuan、GLM、Falcon),大模型高效量化训练与部署。

    622+0近 7 天星标变化
  • Relax@redai-studio

    用于大规模全模态后训练的异步强化学习引擎。

    601+13近 7 天星标变化
  • SPPO@uclaml

    自我博弈偏好优化 (SPPO) 的官方实现

    589+1近 7 天星标变化
  • TextRL@voidful

    在 huggingface transformer 的任何生成模型(blommz-176B/bloom/gpt/bart/T5/MetaICL)上实现 ChatGPT RLHF(人类反馈强化学习)。

    564+0近 7 天星标变化
  • Online-RLHF@RLHFlow

    在线 RLHF 与在线迭代式 DPO 的实现配方。

    545+1近 7 天星标变化
  • 精选的大型语言模型 On-Policy 蒸馏论文与资源合集。

    538+10近 7 天星标变化
  • dLLM-RL@Gen-Verse

    [ICLR 2026] TraceRL 官方代码:彻底改变扩散 LLM 的后训练流程,驱动 SOTA TraDo 系列。

    520+0近 7 天星标变化
← 返回主题列表