主題 · rlhf
rlhf
標記 rlhf 主題、收錄中的開源專案,依星數排序。
共 45 個專案
- #31★ 909-1近 7 天星數變化
- #32★ 824+15近 7 天星數變化
- #33
大型語言模型策略內蒸餾(OPD)的精選論文、技術報告、框架與工具集合
★ 803+32近 7 天星數變化 - #34
Aligning Large Language Models with Human: A Survey
★ 738—近 7 天星數變化 - #35
RewardBench:獎勵模型的第一個評估工具。
★ 735+0近 7 天星數變化 - #36
Trinity-RFT 是一個通用的、靈活且具備可擴展性的框架,專為大型語言模型 (LLM) 的強化微調 (RFT) 而設計。
★ 700+1近 7 天星數變化 - #37★ 669+0近 7 天星數變化
- #38
RLAnything (ICML 2026) 與 AutoTool (ICML 2026),DemyAgent:用於 LLM 與 Agent 場景的開源強化學習
★ 634+4近 7 天星數變化 - #39
簡單且高效的 LLM 微調工具(支援 LLaMA、LLaMA2、LLaMA3、Qwen、Baichuan、GLM、Falcon),大模型高效量化訓練與部署。
★ 621+0近 7 天星數變化 - #40★ 598+12近 7 天星數變化
- #41★ 589+1近 7 天星數變化
- #42
在 huggingface transformer 的任何生成模型(blommz-176B/bloom/gpt/bart/T5/MetaICL)上實作 ChatGPT RLHF(人類回饋強化學習)。
★ 564+0近 7 天星數變化 - #43
線上 RLHF 與線上迭代式 DPO 的實作配方。
★ 545+1近 7 天星數變化 - #44
精選的大型語言模型 On-Policy 蒸餾論文與資源合集。
★ 537+10近 7 天星數變化 - #45★ 520+0近 7 天星數變化