跳到主要内容
buildradar
登录
主题 · reinforcement-learning

reinforcement-learning

标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。

共 305 个项目
  • TextWorld@microsoft

    TextWorld 是一个沙盒学习环境,用于训练和评估文本游戏上的强化学习 (RL) 代理程序。

    1,446+4近 7 天星标变化
  • walk-these-ways@Improbable-AI

    用于 Unitree Go1 机器人的从模拟到真实(Sim-to-real)RL 训练与部署工具。

    1,444+4近 7 天星标变化
  • ReCall@Agent-RL

    ReSearch:通过强化学习为 LLM 学习带搜索的推理与 ReCall:通过强化学习为 LLM 学习带工具调用的推理

    1,434+2近 7 天星标变化
  • 以 Julia 编写的简洁优美算法

    1,426+0近 7 天星标变化
  • 精选的 Model-based RL 资源列表(持续更新)

    1,394+1近 7 天星标变化
  • rl_games@Denys88

    强化学习 (RL) 实现

    1,388+3近 7 天星标变化
  • OpenCat-Old@PetoiCamp

    一款用于 STEM 教育与 AI 增强服务地可编程、高灵活性机器人猫。

    1,373+1近 7 天星标变化
  • DRL-robot-navigation@reiniscimurs

    在 ROS Gazebo 模拟器中用于移动机器人导航的深度强化学习。利用双延迟深度确定性策略梯度 (TD3) 神经网络,机器人在模拟环境中学习导航至随机目标点,同时避开障碍物。

    1,367+5近 7 天星标变化
  • smac@oxwhirl

    SMAC:星际争霸多智能体挑战赛

    1,367+0近 7 天星标变化
  • SLM-Lab@kengz

    基于 PyTorch 的模块化深度强化学习框架。《Foundations of Deep Reinforcement Learning》一书的配套库。

    1,361-1近 7 天星标变化
  • Popular-RL-Algorithms@quantumiracle

    Soft Actor-Critic (SAC)、Twin Delayed DDPG (TD3)、Actor-Critic (AC/A2C)、Proximal Policy Optimization (PPO)、QT-Opt、PointNet 的 PyTorch 实现..

    1,359+0近 7 天星标变化
  • agent-apprenticeship@ray-r-ren

    一个充满活力的生态系统,在此系统中 AI agent 通过工作流程循环完成任务、藉由迭代执行来改进、通过导师 agent 或人工介入进行评估,并将已完成的工作转化为可重复使用的工作经验与数据,以提升未来的 agent。

    1,334+0近 7 天星标变化
  • 使用 Keras 实现的极简深度 Q 学习(DQN 与 DDQN)

    1,329+0近 7 天星标变化
  • Learning-Deep-Learning@patrick-llgc

    深度学习与机器学习的论文阅读笔记

    1,273+3近 7 天星标变化
  • PPO-for-Beginners@ericyangyu

    一个简单且风格良好的 PPO 实现。基于我的 Medium 系列文章:https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8

    1,270+1近 7 天星标变化
  • MO-Gymnasium@Farama-Foundation

    用于强化学习的多目标 Gymnasium 环境

    1,244+484近 7 天星标变化
  • android_env@google-deepmind

    在 Android 设备上进行 RL 研究。

    1,241+1近 7 天星标变化
  • alphagen@ICT-FinD-Lab

    通过强化学习生成公式化阿尔法(预测性)股票因子集。

    1,227+14近 7 天星标变化
  • LearningHumanoidWalking@rohanpsingh

    使用强化学习训练人形机器人进行移动

    1,214+4近 7 天星标变化
  • 帕德博恩大学(Paderborn University)强化学习课程的讲义、包含解答的实操练习以及在线视频

    1,193+1近 7 天星标变化
  • flow@flow-project

    用于交通控制中强化学习的计算框架

    1,189+1近 7 天星标变化
  • Gym@NVIDIA-NeMo

    使用环境评估并改善模型与 agent

    1,181+26近 7 天星标变化
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO:通过混合 ODE-SDE 解锁基于 Flow 的 GRPO 效率

    1,177+0近 7 天星标变化
  • SimplerEnv@simpler-env

    在模拟环境与常见设置(如 Google Robot、WidowX+Bridge)下评估与重现真实世界的机器人操作策略(例如 RT-1、RT-1-X、Octo)(CoRL 2024)

    1,161+8近 7 天星标变化
  • omnisafe@PKU-Alignment

    JMLR:OmniSafe 是用于加速 SafeRL 研究的基础设施框架。

    1,150+0近 7 天星标变化
  • evotorch@nnaisense

    直接构建于 PyTorch 之上的高级演化计算库,由 NNAISENSE 创建。

    1,146+2近 7 天星标变化
  • SMARTS@huawei-noah

    用于自动驾驶的可扩展多智能体强化学习训练学校

    1,133-1近 7 天星标变化
  • ir-sim@hanruihua

    一个基于 Python 的轻量级机器人模拟器,专为导航、控制与学习而设计

    1,130+5近 7 天星标变化
  • :computer: 学习让机器学习,这样你就不用辛苦编写程序;终极清单

    1,129+1近 7 天星标变化
  • ASE@nv-tlabs

    用于训练具物理模拟角色之可重复使用控制器的对抗性技能嵌入。

    1,123+4近 7 天星标变化
← 返回主题列表