主题 · rlhf
rlhf
标记 rlhf 主题、收录中的开源项目,按星标数排序。
共 45 个项目
- #31★ 909-1近 7 天星标变化
- #32★ 828+15近 7 天星标变化
- #33
大语言模型策略内蒸馏(OPD)的精选论文、技术报告、框架与工具集合
★ 812+32近 7 天星标变化 - #34
Aligning Large Language Models with Human: A Survey
★ 738—近 7 天星标变化 - #35
RewardBench:奖励模型的第一个评估工具。
★ 735+0近 7 天星标变化 - #36
Trinity-RFT 是一个通用的、灵活且具备可扩展性的框架,专为大型语言模型 (LLM) 的强化微调 (RFT) 而设计。
★ 700+2近 7 天星标变化 - #37★ 669+0近 7 天星标变化
- #38
RLAnything (ICML 2026) 与 AutoTool (ICML 2026),DemyAgent:用于 LLM 与 Agent 场景的开源强化学习
★ 635+4近 7 天星标变化 - #39
简单且高效的 LLM 微调工具(支持 LLaMA、LLaMA2、LLaMA3、Qwen、Baichuan、GLM、Falcon),大模型高效量化训练与部署。
★ 622+0近 7 天星标变化 - #40★ 601+13近 7 天星标变化
- #41★ 589+1近 7 天星标变化
- #42
在 huggingface transformer 的任何生成模型(blommz-176B/bloom/gpt/bart/T5/MetaICL)上实现 ChatGPT RLHF(人类反馈强化学习)。
★ 564+0近 7 天星标变化 - #43
在线 RLHF 与在线迭代式 DPO 的实现配方。
★ 545+1近 7 天星标变化 - #44
精选的大型语言模型 On-Policy 蒸馏论文与资源合集。
★ 538+10近 7 天星标变化 - #45★ 520+0近 7 天星标变化