跳到主要內容
buildradar
Sign in
主題 · rlhf

rlhf

標記 rlhf 主題、收錄中的開源專案,依星數排序。

專案數
44
總星數
223,657
平均星數
5,083
佔比
0.01%

常跟 rlhf 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 rlhf 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • LlamaFactory@hiyouga

    統一高效微調 100 多種 LLM 與 VLM(ACL 2024)

    74,532+145近 7 天星數變化
  • Open-Assistant@LAION-AI

    OpenAssistant 是一個聊天式助理,能理解任務、與第三方系統互動,並動態檢索資訊以完成任務

    37,401-7近 7 天星數變化
  • LLMSurvey@RUCAIBox

    "A Survey of Large Language Models" 调查论文的官方 GitHub 页面

    12,208+2近 7 天星數變化
  • InternLM@InternLM

    InternLM 系列正式發布(InternLM、InternLM2、InternLM2.5、InternLM3)

    7,277+8近 7 天星數變化
  • 中文 LLaMA-2 與 Alpaca-2 大模型二期專案 + 64K 超長上下文模型

    7,120+0近 7 天星數變化
  • alignment-handbook@huggingface

    穩健的配方,將語言模型對齊人類與 AI 的偏好

    5,670-1近 7 天星數變化
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL:僅通過對話即可訓練任何代理

    5,665+10近 7 天星數變化
  • transformerlab-app@transformerlab

    面向 AI 研究者的开源研究环境,支持从本地硬件到 GPU 集群无缝训练、评估和扩展模型。

    5,185+6近 7 天星數變化
  • reasoning-from-scratch@rasbt

    從零開始在 PyTorch 中實現推理 LLM,逐步說明

    5,138+67近 7 天星數變化
  • argilla@argilla-io

    Argilla 是一個協作工具,供 AI 工程師與領域專家構建高品質資料集

    5,093+8近 7 天星數變化
  • Kiln@Kiln-AI

    構建、評估與優化 AI 系統。包含評估、RAG、代理、微調、合成數據生成、資料集管理、MCP 等。

    5,042+7近 7 天星數變化
  • align-anything@PKU-Alignment

    Align Anything:使用回饋訓練全模態模型

    4,671+4近 7 天星數變化
  • awesome-RLHF@opendilab

    一份經過精選的強化學習與人類反饋資源列表(持續更新)

    4,424+2近 7 天星數變化
  • hands-on-modern-rl@walkinglabs

    🚀 一個開源、實作導向的課程,彌合基礎 RL 概念與 LLM 對齊、RLVR 及進階代理系統之間的差距

    4,199+69近 7 天星數變化
  • docta@Docta-ai

    一個為你的數據提供醫生的工具

    3,485-1近 7 天星數變化
  • distilabel@argilla-io

    Distilabel 是一個基於已驗證研究論文的合成數據與 AI 回饋框架,專為需要快速、可靠且具擴充性管線的工程師設計。

    3,384+6近 7 天星數變化
  • ROLL@alibaba

    高效且使用者友善的擴充學習庫,支援大型語言模型的強化學習

    3,380+6近 7 天星數變化
  • TorchLeet@Exorust

    PyTorch 的 LeetCode — 來自 Google、Meta、Anthropic 真實面試的 65 道 ML/AI 面試題。包含 Jupyter notebooks、自動評分器以及 MCP AI 家教。

    2,461+30近 7 天星數變化
  • rlhf-book@natolambert

    人類回饋強化學習(RLHF)教科書

    2,357+12近 7 天星數變化
  • alpaca_eval@tatsu-lab

    指令遵循語言模型的自動評估器。經人工驗證、高品質、低成本且快速。

    2,012+0近 7 天星數變化
  • AgentsMeetRL@thinkwee

    Agentic RL 精選清單

    1,832+33近 7 天星數變化
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward:學習與評估文字轉圖像生成的人類偏好

    1,703+1近 7 天星數變化
  • safe-rlhf@PKU-Alignment

    Safe RLHF:透過來自人類回饋的安全強化學習進行受約束的價值對齊

    1,613+2近 7 天星數變化
  • WebGLM@THUDM

    WebGLM:一個高效的網路增強問答系統 (KDD 2023)

    1,601-1近 7 天星數變化
  • 用於訓練 RLHF 獎勵模型的範例與食譜

    1,541+0近 7 天星數變化
  • MOSS-RLHF@OpenLMLab

    大型語言模型中 RLHF 的祕密第一部:PPO

    1,430+1近 7 天星數變化
  • xtreme1@xtreme1-io

    Xtreme1 是一個用於多模態資料訓練的整合式資料標註與註解平台,支援 3D LiDAR 點雲、影像和 LLM。

    1,239+5近 7 天星數變化
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO:基於無參照獎勵的簡單偏好最佳化

    959+1近 7 天星數變化
  • verl-omni@verl-project

    針對擴散與全能模型的多模態 RL 訓練框架

    955+56近 7 天星數變化
  • AI-Compass@tingaicompass

    「AI-Compass」將為社群指引在 AI 技術海洋中航行的方向,無論你是初學者還是進階開發者,都能在這裡找到通往 AI 各大方向的路徑。旨在幫助開發者系統性地了解 AI 的核心概念、主流技術、前沿趨勢,並透過實踐掌握從理論到落地的全過程。

    933+10近 7 天星數變化
← 返回主題列表