跳到主要內容
buildradar
登入
主題 · rlhf

rlhf

標記 rlhf 主題、收錄中的開源專案,依星數排序。

共 45 個專案
  • HALOs@ContextualAI

    一個具有 DPO、KTO、PPO、ORPO 及其他人類意識損失函數(HALO)可擴充實作的程式庫。

    909-1近 7 天星數變化
  • OpenJudge@agentscope-ai

    OpenJudge:用於全面評估與品質獎勵的統一框架

    824+15近 7 天星數變化
  • 大型語言模型策略內蒸餾(OPD)的精選論文、技術報告、框架與工具集合

    803+32近 7 天星數變化
  • Aligning Large Language Models with Human: A Survey

    738近 7 天星數變化
  • reward-bench@allenai

    RewardBench:獎勵模型的第一個評估工具。

    735+0近 7 天星數變化
  • Trinity-RFT@agentscope-ai

    Trinity-RFT 是一個通用的、靈活且具備可擴展性的框架,專為大型語言模型 (LLM) 的強化微調 (RFT) 而設計。

    700+1近 7 天星數變化
  • oat@sail-sg

    🌾 OAT:一個對研究友善的 LLM 線上對齊框架,包含強化學習、偏好學習等。

    669+0近 7 天星數變化
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) 與 AutoTool (ICML 2026),DemyAgent:用於 LLM 與 Agent 場景的開源強化學習

    634+4近 7 天星數變化
  • LLamaTuner@jianzhnie

    簡單且高效的 LLM 微調工具(支援 LLaMA、LLaMA2、LLaMA3、Qwen、Baichuan、GLM、Falcon),大模型高效量化訓練與部署。

    621+0近 7 天星數變化
  • Relax@redai-studio

    用於大規模全模態後訓練的非同步強化學習引擎。

    598+12近 7 天星數變化
  • SPPO@uclaml

    自我博弈偏好最佳化 (SPPO) 的官方實作

    589+1近 7 天星數變化
  • TextRL@voidful

    在 huggingface transformer 的任何生成模型(blommz-176B/bloom/gpt/bart/T5/MetaICL)上實作 ChatGPT RLHF(人類回饋強化學習)。

    564+0近 7 天星數變化
  • Online-RLHF@RLHFlow

    線上 RLHF 與線上迭代式 DPO 的實作配方。

    545+1近 7 天星數變化
  • 精選的大型語言模型 On-Policy 蒸餾論文與資源合集。

    537+10近 7 天星數變化
  • dLLM-RL@Gen-Verse

    [ICLR 2026] TraceRL 官方程式碼:徹底改變擴散 LLM 的後訓練流程,驅動 SOTA TraDo 系列。

    520+0近 7 天星數變化
← 返回主題列表