跳到主要內容
buildradar
Sign in
主題 · rl

rl

標記 rl 主題、收錄中的開源專案,依星數排序。

專案數
46
總星數
113,768
平均星數
2,473
佔比
0.01%

常跟 rl 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 rl 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • Llama-Chinese@LlamaChinese

    Llama中文社区,实时汇总最新Llama学习资料,构建最好的中文Llama大模型开源生态,完全开源可商用

    14,743+3近 7 天星數變化
  • tianshou@thu-ml

    優雅的 PyTorch 深度強化學習函式庫

    10,955+10近 7 天星數變化
  • dopamine@google

    Dopamine 是用於快速原型化強化學習演算法的研究框架。

    10,909+8近 7 天星數變化
  • ART@OpenPipe

    Agent Reinforcement Trainer:使用 GRPO 訓練多步驟代理以執行真實任務。為您的代理提供在職訓練。支援 Qwen3.6、GPT-OSS、Llama 等的強化學習

    10,689+10近 7 天星數變化
  • AReaL@areal-project

    LLM 基於代理應用的 RL Bridge,簡單且靈活

    5,712+9近 7 天星數變化
  • EasyR1@hiyouga

    EasyR1:一個基於 veRL 的高效、可擴展、多模態 RL 訓練框架。

    5,141+5近 7 天星數變化
  • hands-on-modern-rl@walkinglabs

    🚀 一個開源、實作導向的課程,彌合基礎 RL 概念與 LLM 對齊、RLVR 及進階代理系統之間的差距

    4,199+54近 7 天星數變化
  • agent-sandbox@kubernetes-sigs

    agent-sandbox 方便管理隔離、具狀態、單例工作負載,適用於 AI 代理執行環境與強化學習 (RL) 等使用情境。

    3,719+41近 7 天星數變化
  • AlphaZero_Gomoku@junxiaosong

    AlphaZero 演算法在圍棋五子棋(亦稱 Gobang 或 Five in a Row)的實作

    3,627+2近 7 天星數變化
  • rl@pytorch

    一個模組化、原始型優先、Python 首先的 PyTorch Reinforcement Learning 函式庫。

    3,545+5近 7 天星數變化
  • 用於 Stable Baselines3 強化學習代理的訓練框架,包含超參數優化與預訓練代理。

    2,873+1近 7 天星數變化
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    用 100 行程式碼實作論文

    2,870+3近 7 天星數變化
  • muzero-general@werner-duvaud

    MuZero

    2,865+2近 7 天星數變化
  • Awesome-RL-for-LRMs@TsinghuaC3I

    大型推理模型的強化學習綜述

    2,483+1近 7 天星數變化
  • all-rl-algorithms@FareedKhan-dev

    以更簡單的方式實現所有強化學習(RL)演算法

    1,929+7近 7 天星數變化
  • PRIME@PRIME-RL

    用於語言模型進階推理的可擴展 RL 解決方案

    1,871-1近 7 天星數變化
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL:透過強化學習擴展 VLA 訓練

    1,844+6近 7 天星數變化
  • System-2 推理的最新進展

    1,353+0近 7 天星數變化
  • diy-llm@datawhalechina

    🎓 系統性大語言模型建構課程|🛠️ 涵蓋預訓練資料工程、Tokenizer、Transformer、MoE、GPU 編程 (CUDA/Triton)、分散式訓練、Scaling Laws、推理最佳化及對齊 (SFT/RLHF/GRPO)|🚀 6 個漸進式作業 + 程式碼驅動,建立 LLM 全端認知體系

    1,276+19近 7 天星數變化
  • understand-r1-zero@sail-sg

    理解 R1-Zero 風格訓練:批判性視角

    1,274+0近 7 天星數變化
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL:測試期強化學習

    1,122+1近 7 天星數變化
  • ARPO@RUC-NLPIR

    [ICLR 2026] 代理式強化策略最佳化 (ARPO)

    1,116+3近 7 天星數變化
  • SDPO@lasgroup

    透過自我蒸餾的強化學習(SDPO)

    1,090+11近 7 天星數變化
  • judgeval@JudgmentLabs

    面向 Agent 的持續改進堆疊。我們的環境資料與評估為 Agent 的改進和監控提供動力。

    1,060+2近 7 天星數變化
  • tensorlake@tensorlakeai

    Tensorlake 是一個用於沙箱及部署背景 agentic 應用程式的無伺服器執行環境

    995+2近 7 天星數變化
  • OpenDerisk@derisk-ai

    AI-Native 風險智慧系統,OpenDeRisk——您的應用系統風險智慧管理者,提供 7*24 小時全面且深入的保護。

    971+3近 7 天星數變化
  • mushroom-rl@MushroomRL

    用於強化學習的 Python 函式庫

    944+0近 7 天星數變化
  • AI-Compass@tingaicompass

    「AI-Compass」將為社群指引在 AI 技術海洋中航行的方向,無論你是初學者還是進階開發者,都能在這裡找到通往 AI 各大方向的路徑。旨在幫助開發者系統性地了解 AI 的核心概念、主流技術、前沿趨勢,並透過實踐掌握從理論到落地的全過程。

    933+10近 7 天星數變化
  • zeroth-bot@zeroth-robotics

    用於 sim-to-real 與強化學習的 3D 列印開源人形機器人平台

    822+2近 7 天星數變化
  • 大型語言模型策略內蒸餾(OPD)的精選論文、技術報告、框架與工具集合

    791+26近 7 天星數變化
← 返回主題列表