跳到主要内容
buildradar
Sign in
主题 · reinforcement-learning-algorithms

reinforcement-learning-algorithms

标记 reinforcement-learning-algorithms 主题、收录中的开源项目,按星标数排序。

项目数
21
总星标数
39,604
平均星标数
1,886
占比
0.00%

常跟 reinforcement-learning-algorithms 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 reinforcement-learning-algorithms 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • PyTorch version of Stable Baselines, reliable implementations of reinforcement learning algorithms.

    13,758+21近 7 天星标变化
  • deep-reinforcement-learning@udacity

    Deep Reinforcement Learning Nanodegree 课程的仓库

    5,176+0近 7 天星标变化
  • DI-engine@opendilab

    OpenDILab Decision AI Engine。最全面的强化学习框架 B.P.

    3,642+1近 7 天星标变化
  • PPO-PyTorch@nikhilbarhate99

    在 PyTorch 中最小化实现截断目标的近端策略优化(PPO)

    2,381+6近 7 天星标变化
  • 精选的 Model-based RL 资源列表(持续更新)

    1,393+0近 7 天星标变化
  • PPO-for-Beginners@ericyangyu

    一个简单且风格良好的 PPO 实现。基于我的 Medium 系列文章:https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8

    1,269+1近 7 天星标变化
  • ARPO@RUC-NLPIR

    [ICLR 2026] 代理式强化策略优化 (ARPO)

    1,116+5近 7 天星标变化
  • purejaxrl@luchris429

    极速的端到端 Jax RL 实现

    1,103+3近 7 天星标变化
  • UI-Venus@inclusionAI

    UI-Venus 是一个原生的 UI 代理,旨在仅使用截图作为输入,执行精确的 GUI 元素定位与有效的导航。

    1,037+23近 7 天星标变化
  • 精选的 Decision Transformer 资源列表(持续更新)

    917+0近 7 天星标变化
  • course-content-dl@NeuromatchAcademy

    NMA 深度学习课程

    812+1近 7 天星标变化
  • POMDPs.jl@JuliaPOMDP

    Julia 中的 MDP 与 POMDP——一个用于在离散和连续空间中定义、求解及模拟完全与部分可观测马尔可夫决策过程的接口。

    767+1近 7 天星标变化
  • stable-baselines3-contrib@Stable-Baselines-Team

    Stable-Baselines3 的贡献套件 - 实验性强化学习(RL)代码

    736+5近 7 天星标变化
  • 这是一个关于无人机深度强化学习自主避障算法的项目。

    730+0近 7 天星标变化
  • disco_rl@google-deepmind

    Nature 期刊论文“探索最先进的强化学习算法”之配套代码。

    729+2近 7 天星标变化
  • 精选的探索式强化学习 (RL) 资源清单(持续更新)

    723+0近 7 天星标变化
  • UAV-DDPG@fangvv

    论文“Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach”的代码。

    722+1近 7 天星标变化
  • Rofunc@Skylark0924

    🤖 用于从示范中学习机器人与机器人操作的完整流程 Python 软件包

    720+1近 7 天星标变化
  • 精选的蒙特卡洛树搜索论文及其实作列表。

    715+1近 7 天星标变化
  • 用于构建深度强化学习智能体的 PyTorch 库

    657+0近 7 天星标变化
  • dLLM-RL@Gen-Verse

    [ICLR 2026] TraceRL 官方代码:彻底改变扩散 LLM 的后训练流程,驱动 SOTA TraDo 系列。

    520+1近 7 天星标变化
← 返回主题列表