rl
标记 rl 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 rl 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 rl 主题的项目。
近 90 天内还没有新项目标记这个主题。
- #1
Llama中文社区,实时汇总最新Llama学习资料,构建最好的中文Llama大模型开源生态,完全开源可商用
★ 14,743+3近 7 天星标变化 - #2★ 10,955+10近 7 天星标变化
- #3★ 10,909+8近 7 天星标变化
- #4
Agent Reinforcement Trainer:使用 GRPO 训练多步骤代理以执行真实任务。为您的代理提供在职培训。支持 Qwen3.6、GPT-OSS、Llama 等的强化学习
★ 10,689+10近 7 天星标变化 - #5★ 5,712+9近 7 天星标变化
- #6★ 5,141+5近 7 天星标变化
- #7
🚀 一个开源、实作导向的课程,弥合基础 RL 概念与 LLM 对齐、RLVR 及进阶代理系统之间的差距
★ 4,199+54近 7 天星标变化 - #8
agent-sandbox 方便管理隔离、具状态、单例工作负载,适用于 AI 代理执行环境与强化学习 (RL) 等使用情境。
★ 3,719+41近 7 天星标变化 - #9
AlphaZero 算法在五子棋(亦称 Gobang 或 Five in a Row)的实现
★ 3,627+2近 7 天星标变化 - #10★ 3,545+5近 7 天星标变化
- #11
用于 Stable Baselines3 强化学习智能体的训练框架,包含超参数优化与预训练智能体。
★ 2,873+1近 7 天星标变化 - #12
用 100 行代码实现论文
★ 2,870+3近 7 天星标变化 - #13
MuZero
★ 2,865+2近 7 天星标变化 - #14
大型推理模型的强化学习综述
★ 2,483+1近 7 天星标变化 - #15
以更简单的方式实现所有强化学习(RL)算法
★ 1,929+7近 7 天星标变化 - #16★ 1,871-1近 7 天星标变化
- #17
[ICLR 2026] SimpleVLA-RL:通过强化学习扩展 VLA 训练
★ 1,844+6近 7 天星标变化 - #18
System-2 推理的最新进展
★ 1,353+0近 7 天星标变化 - #19
🎓 系统性大语言模型构建课程|🛠️ 涵盖预训练数据工程、Tokenizer、Transformer、MoE、GPU 编程 (CUDA/Triton)、分布式训练、Scaling Laws、推理优化及对齐 (SFT/RLHF/GRPO)|🚀 6 个渐进式作业 + 代码驱动,建立 LLM 全栈认知体系
★ 1,276+19近 7 天星标变化 - #20
理解 R1-Zero 风格训练:批判性视角
★ 1,274+0近 7 天星标变化 - #21★ 1,123+2近 7 天星标变化
- #22★ 1,117+5近 7 天星标变化
- #23★ 1,093+15近 7 天星标变化
- #24★ 1,060+2近 7 天星标变化
- #25
Tensorlake 是一个用于沙箱及部署背景 agentic 应用程序的无服务器运行时
★ 996+2近 7 天星标变化 - #26
AI-Native 风险智能系统,OpenDeRisk——您的应用系统风险智能管理者,提供 7*24 小时全面且深入的保护。
★ 971+3近 7 天星标变化 - #27
用于强化学习的 Python 库
★ 944+0近 7 天星标变化 - #28
“AI-Compass”将为社区指引在 AI 技术海洋中航行的方向,无论你是初学者还是进阶开发者,都能在这里找到通往 AI 各大方向的路径。旨在帮助开发者系统性地了解 AI 的核心概念、主流技术、前沿趋势,并通过实践掌握从理论到落地的全过程。
★ 937+12近 7 天星标变化 - #29
用于 sim-to-real 与强化学习的 3D 打印开源人形机器人平台
★ 823+3近 7 天星标变化 - #30
大语言模型策略内蒸馏(OPD)的精选论文、技术报告、框架与工具集合
★ 803+34近 7 天星标变化