rl
標記 rl 主題、收錄中的開源專案,依星數排序。
相關主題
常跟 rl 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 rl 主題的專案。
近 90 天內還沒有新專案標記這個主題。
- #1
Llama中文社区,实时汇总最新Llama学习资料,构建最好的中文Llama大模型开源生态,完全开源可商用
★ 14,743+3近 7 天星數變化 - #2★ 10,955+10近 7 天星數變化
- #3★ 10,909+8近 7 天星數變化
- #4
Agent Reinforcement Trainer:使用 GRPO 訓練多步驟代理以執行真實任務。為您的代理提供在職訓練。支援 Qwen3.6、GPT-OSS、Llama 等的強化學習
★ 10,689+10近 7 天星數變化 - #5★ 5,712+9近 7 天星數變化
- #6★ 5,141+5近 7 天星數變化
- #7
🚀 一個開源、實作導向的課程,彌合基礎 RL 概念與 LLM 對齊、RLVR 及進階代理系統之間的差距
★ 4,199+54近 7 天星數變化 - #8
agent-sandbox 方便管理隔離、具狀態、單例工作負載,適用於 AI 代理執行環境與強化學習 (RL) 等使用情境。
★ 3,719+41近 7 天星數變化 - #9
AlphaZero 演算法在圍棋五子棋(亦稱 Gobang 或 Five in a Row)的實作
★ 3,627+2近 7 天星數變化 - #10★ 3,545+5近 7 天星數變化
- #11
用於 Stable Baselines3 強化學習代理的訓練框架,包含超參數優化與預訓練代理。
★ 2,873+1近 7 天星數變化 - #12
用 100 行程式碼實作論文
★ 2,870+3近 7 天星數變化 - #13
MuZero
★ 2,865+2近 7 天星數變化 - #14
大型推理模型的強化學習綜述
★ 2,483+1近 7 天星數變化 - #15
以更簡單的方式實現所有強化學習(RL)演算法
★ 1,929+7近 7 天星數變化 - #16★ 1,871-1近 7 天星數變化
- #17
[ICLR 2026] SimpleVLA-RL:透過強化學習擴展 VLA 訓練
★ 1,844+6近 7 天星數變化 - #18
System-2 推理的最新進展
★ 1,353+0近 7 天星數變化 - #19
🎓 系統性大語言模型建構課程|🛠️ 涵蓋預訓練資料工程、Tokenizer、Transformer、MoE、GPU 編程 (CUDA/Triton)、分散式訓練、Scaling Laws、推理最佳化及對齊 (SFT/RLHF/GRPO)|🚀 6 個漸進式作業 + 程式碼驅動,建立 LLM 全端認知體系
★ 1,276+19近 7 天星數變化 - #20
理解 R1-Zero 風格訓練:批判性視角
★ 1,274+0近 7 天星數變化 - #21★ 1,122+1近 7 天星數變化
- #22★ 1,116+3近 7 天星數變化
- #23★ 1,090+11近 7 天星數變化
- #24★ 1,060+2近 7 天星數變化
- #25
Tensorlake 是一個用於沙箱及部署背景 agentic 應用程式的無伺服器執行環境
★ 995+2近 7 天星數變化 - #26
AI-Native 風險智慧系統,OpenDeRisk——您的應用系統風險智慧管理者,提供 7*24 小時全面且深入的保護。
★ 971+3近 7 天星數變化 - #27
用於強化學習的 Python 函式庫
★ 944+0近 7 天星數變化 - #28
「AI-Compass」將為社群指引在 AI 技術海洋中航行的方向,無論你是初學者還是進階開發者,都能在這裡找到通往 AI 各大方向的路徑。旨在幫助開發者系統性地了解 AI 的核心概念、主流技術、前沿趨勢,並透過實踐掌握從理論到落地的全過程。
★ 933+10近 7 天星數變化 - #29
用於 sim-to-real 與強化學習的 3D 列印開源人形機器人平台
★ 822+2近 7 天星數變化 - #30
大型語言模型策略內蒸餾(OPD)的精選論文、技術報告、框架與工具集合
★ 791+26近 7 天星數變化