跳到主要内容
buildradar
Sign in
主题 · rl

rl

标记 rl 主题、收录中的开源项目,按星标数排序。

项目数
46
总星标数
113,768
平均星标数
2,473
占比
0.01%

常跟 rl 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 rl 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • Llama-Chinese@LlamaChinese

    Llama中文社区,实时汇总最新Llama学习资料,构建最好的中文Llama大模型开源生态,完全开源可商用

    14,743+3近 7 天星标变化
  • tianshou@thu-ml

    优雅的 PyTorch 深度强化学习库

    10,955+10近 7 天星标变化
  • dopamine@google

    Dopamine 是用于快速原型化强化学习算法的研究框架。

    10,909+8近 7 天星标变化
  • ART@OpenPipe

    Agent Reinforcement Trainer:使用 GRPO 训练多步骤代理以执行真实任务。为您的代理提供在职培训。支持 Qwen3.6、GPT-OSS、Llama 等的强化学习

    10,689+10近 7 天星标变化
  • AReaL@areal-project

    LLM 基于代理应用的 RL Bridge,简单且灵活

    5,712+9近 7 天星标变化
  • EasyR1@hiyouga

    EasyR1:一个基于 veRL 的高效、可扩展、多模态 RL 训练框架。

    5,141+5近 7 天星标变化
  • hands-on-modern-rl@walkinglabs

    🚀 一个开源、实作导向的课程,弥合基础 RL 概念与 LLM 对齐、RLVR 及进阶代理系统之间的差距

    4,199+54近 7 天星标变化
  • agent-sandbox@kubernetes-sigs

    agent-sandbox 方便管理隔离、具状态、单例工作负载,适用于 AI 代理执行环境与强化学习 (RL) 等使用情境。

    3,719+41近 7 天星标变化
  • AlphaZero_Gomoku@junxiaosong

    AlphaZero 算法在五子棋(亦称 Gobang 或 Five in a Row)的实现

    3,627+2近 7 天星标变化
  • rl@pytorch

    一个模块化、原始型优先、Python 首先的 PyTorch Reinforcement Learning 函数库。

    3,545+5近 7 天星标变化
  • 用于 Stable Baselines3 强化学习智能体的训练框架,包含超参数优化与预训练智能体。

    2,873+1近 7 天星标变化
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    用 100 行代码实现论文

    2,870+3近 7 天星标变化
  • muzero-general@werner-duvaud

    MuZero

    2,865+2近 7 天星标变化
  • Awesome-RL-for-LRMs@TsinghuaC3I

    大型推理模型的强化学习综述

    2,483+1近 7 天星标变化
  • all-rl-algorithms@FareedKhan-dev

    以更简单的方式实现所有强化学习(RL)算法

    1,929+7近 7 天星标变化
  • PRIME@PRIME-RL

    用于语言模型高级推理的可扩展 RL 解决方案

    1,871-1近 7 天星标变化
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL:通过强化学习扩展 VLA 训练

    1,844+6近 7 天星标变化
  • System-2 推理的最新进展

    1,353+0近 7 天星标变化
  • diy-llm@datawhalechina

    🎓 系统性大语言模型构建课程|🛠️ 涵盖预训练数据工程、Tokenizer、Transformer、MoE、GPU 编程 (CUDA/Triton)、分布式训练、Scaling Laws、推理优化及对齐 (SFT/RLHF/GRPO)|🚀 6 个渐进式作业 + 代码驱动,建立 LLM 全栈认知体系

    1,276+19近 7 天星标变化
  • understand-r1-zero@sail-sg

    理解 R1-Zero 风格训练:批判性视角

    1,274+0近 7 天星标变化
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL:测试期强化学习

    1,123+2近 7 天星标变化
  • ARPO@RUC-NLPIR

    [ICLR 2026] 代理式强化策略优化 (ARPO)

    1,117+5近 7 天星标变化
  • SDPO@lasgroup

    通过自我蒸馏的强化学习(SDPO)

    1,093+15近 7 天星标变化
  • judgeval@JudgmentLabs

    面向 Agent 的持续改进栈。我们的环境数据与评估为 Agent 的改进和监控提供动力。

    1,060+2近 7 天星标变化
  • tensorlake@tensorlakeai

    Tensorlake 是一个用于沙箱及部署背景 agentic 应用程序的无服务器运行时

    996+2近 7 天星标变化
  • OpenDerisk@derisk-ai

    AI-Native 风险智能系统,OpenDeRisk——您的应用系统风险智能管理者,提供 7*24 小时全面且深入的保护。

    971+3近 7 天星标变化
  • mushroom-rl@MushroomRL

    用于强化学习的 Python 库

    944+0近 7 天星标变化
  • AI-Compass@tingaicompass

    “AI-Compass”将为社区指引在 AI 技术海洋中航行的方向,无论你是初学者还是进阶开发者,都能在这里找到通往 AI 各大方向的路径。旨在帮助开发者系统性地了解 AI 的核心概念、主流技术、前沿趋势,并通过实践掌握从理论到落地的全过程。

    937+12近 7 天星标变化
  • zeroth-bot@zeroth-robotics

    用于 sim-to-real 与强化学习的 3D 打印开源人形机器人平台

    823+3近 7 天星标变化
  • 大语言模型策略内蒸馏(OPD)的精选论文、技术报告、框架与工具集合

    803+34近 7 天星标变化
← 返回主题列表