跳到主要內容
buildradar
登入
主題 · reinforcement-learning-from-human-feedback

reinforcement-learning-from-human-feedback

標記 reinforcement-learning-from-human-feedback 主題、收錄中的開源專案,依星數排序。

專案數
3
總星數
12,426
平均星數
4,142
佔比
0.00%

常跟 reinforcement-learning-from-human-feedback 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 reinforcement-learning-from-human-feedback 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • OpenRLHF@OpenRLHF

    一個易於使用、可擴展且高效能的 Agentic RL 框架,基於 Ray(PPO、DAPO、REINFORCE++、VLM、TIS、vLLM、Ray、Async RL)

    9,969+0近 7 天星數變化
  • safe-rlhf@PKU-Alignment

    Safe RLHF:透過來自人類回饋的安全強化學習進行受約束的價值對齊

    1,613+0近 7 天星數變化
  • alpaca_farm@tatsu-lab

    用於 RLHF 及其替代方案的模擬框架。無需收集人類數據即可開發您的 RLHF 方法。

    844+0近 7 天星數變化
← 返回主題列表