跳到主要内容
buildradar
Sign in
主题 · rlhf

rlhf

标记 rlhf 主题、收录中的开源项目,按星标数排序。

项目数
44
总星标数
223,657
平均星标数
5,083
占比
0.01%

常跟 rlhf 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 rlhf 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • LlamaFactory@hiyouga

    统一高效微调 100 多种 LLM 与 VLM(ACL 2024)

    74,532+89近 7 天星标变化
  • Open-Assistant@LAION-AI

    OpenAssistant 是一个聊天式助理,能理解任务、与第三方系统互动,并动态检索信息以完成任务

    37,401-7近 7 天星标变化
  • LLMSurvey@RUCAIBox

    "A Survey of Large Language Models" 调查论文的官方 GitHub 页面

    12,208+2近 7 天星标变化
  • InternLM@InternLM

    InternLM 系列正式发布(InternLM、InternLM2、InternLM2.5、InternLM3)

    7,277+4近 7 天星标变化
  • 中文 LLaMA-2 与 Alpaca-2 大模型二期项目 + 64K 超长上下文模型

    7,120+0近 7 天星标变化
  • alignment-handbook@huggingface

    稳健的配方,将语言模型对齐人类与 AI 的偏好

    5,670-3近 7 天星标变化
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL:仅通过对话即可训练任何代理

    5,665+7近 7 天星标变化
  • transformerlab-app@transformerlab

    面向 AI 研究者的开源研究环境,支持从本地硬件到 GPU 集群无缝训练、评估和扩展模型。

    5,185+3近 7 天星标变化
  • reasoning-from-scratch@rasbt

    从零开始在 PyTorch 中实现推理 LLM,逐步说明

    5,138+49近 7 天星标变化
  • argilla@argilla-io

    Argilla 是一个协作工具,供 AI 工程师与领域专家构建高质量数据集

    5,093+5近 7 天星标变化
  • Kiln@Kiln-AI

    构建、评估与优化 AI 系统。包含评估、RAG、代理、微调、合成数据生成、数据集管理、MCP 等。

    5,042+5近 7 天星标变化
  • align-anything@PKU-Alignment

    Align Anything:使用反馈训练全模态模型

    4,671+3近 7 天星标变化
  • awesome-RLHF@opendilab

    一份经过精选的强化学习与人类反馈资源列表(持续更新)

    4,424+2近 7 天星标变化
  • hands-on-modern-rl@walkinglabs

    🚀 一个开源、实作导向的课程,弥合基础 RL 概念与 LLM 对齐、RLVR 及进阶代理系统之间的差距

    4,199+54近 7 天星标变化
  • docta@Docta-ai

    一个为你的数据提供医生的工具

    3,485-1近 7 天星标变化
  • distilabel@argilla-io

    Distilabel 是一个基于已验证研究论文的合成数据与 AI 反馈框架,专为需要快速、可靠且具扩展性流水线的工程师设计。

    3,384+3近 7 天星标变化
  • ROLL@alibaba

    高效且用户友好的扩展学习库,支持大型语言模型的强化学习

    3,380+6近 7 天星标变化
  • TorchLeet@Exorust

    PyTorch 的 LeetCode — 来自 Google、Meta、Anthropic 真实面试的 65 道 ML/AI 面试题。包含 Jupyter notebooks、自动评分器以及 MCP AI 家教。

    2,461+12近 7 天星标变化
  • rlhf-book@natolambert

    人类反馈强化学习(RLHF)教科书

    2,357+11近 7 天星标变化
  • alpaca_eval@tatsu-lab

    指令遵循语言模型的自动评估器。经人工验证、高质量、低成本且快速。

    2,012-1近 7 天星标变化
  • AgentsMeetRL@thinkwee

    Agentic RL 精选列表

    1,832+29近 7 天星标变化
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward:学习与评估文本到图像生成的人类偏好

    1,703+1近 7 天星标变化
  • safe-rlhf@PKU-Alignment

    Safe RLHF:通过来自人类反馈的安全强化学习进行受约束的价值对齐

    1,613+1近 7 天星标变化
  • WebGLM@THUDM

    WebGLM:一个高效的网络增强问答系统 (KDD 2023)

    1,601-1近 7 天星标变化
  • 用于训练 RLHF 奖励模型的示例与配方

    1,541+0近 7 天星标变化
  • MOSS-RLHF@OpenLMLab

    大型语言模型中 RLHF 的秘密第一部分:PPO

    1,430+0近 7 天星标变化
  • xtreme1@xtreme1-io

    Xtreme1 是一个用于多模态数据训练的一体化数据标注平台,支持 3D LiDAR 点云、图像和 LLM。

    1,239+2近 7 天星标变化
  • verl-omni@verl-project

    针对扩散与全能模型的多模态 RL 训练框架

    959+60近 7 天星标变化
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO:基于无参照奖励的简单偏好优化

    959+1近 7 天星标变化
  • AI-Compass@tingaicompass

    “AI-Compass”将为社区指引在 AI 技术海洋中航行的方向,无论你是初学者还是进阶开发者,都能在这里找到通往 AI 各大方向的路径。旨在帮助开发者系统性地了解 AI 的核心概念、主流技术、前沿趋势,并通过实践掌握从理论到落地的全过程。

    933+10近 7 天星标变化
← 返回主题列表