跳到主要内容
buildradar
登录
主题 · reinforcement-learning-from-human-feedback

reinforcement-learning-from-human-feedback

标记 reinforcement-learning-from-human-feedback 主题、收录中的开源项目,按星标数排序。

项目数
3
总星标数
12,454
平均星标数
4,151
占比
0.00%

常跟 reinforcement-learning-from-human-feedback 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 reinforcement-learning-from-human-feedback 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • OpenRLHF@OpenRLHF

    一个易于使用、可扩展且高效能的 Agentic RL 框架,基于 Ray(PPO、DAPO、REINFORCE++、VLM、TIS、vLLM、Ray、Async RL)

    9,995+26近 7 天星标变化
  • safe-rlhf@PKU-Alignment

    Safe RLHF:通过来自人类反馈的安全强化学习进行受约束的价值对齐

    1,615+2近 7 天星标变化
  • alpaca_farm@tatsu-lab

    用于 RLHF 及其替代方案的模拟框架。无需收集人类数据即可开发您的 RLHF 方法。

    844+0近 7 天星标变化
← 返回主题列表