跳到主要内容
buildradar
登录
主题 · rl

rl

标记 rl 主题、收录中的开源项目,按星标数排序。

共 46 个项目
  • mobilegym@Purewhiter

    MobileGym:用于 Mobile GUI Agent 研究的可验证高并发模拟平台 · 浏览器里运行的安卓模拟器 · Browser-hosted Android Simulator · 可验证评估 · 可扩展的线上 RL 训练

    787+5近 7 天星标变化
  • stable-baselines3-contrib@Stable-Baselines-Team

    Stable-Baselines3 的贡献套件 - 实验性强化学习(RL)代码

    736+1近 7 天星标变化
  • 精选的蒙特卡洛树搜索论文及其实作列表。

    715+0近 7 天星标变化
  • Matterport3DSimulator@peteanderson80

    基于真实全景图像进行强化学习的 AI 研究平台。

    713-1近 7 天星标变化
  • dr-tulu@rlresearch

    DR Tulu 的官方存储库:具备深度研究演进评分标准的强化学习

    706+5近 7 天星标变化
  • irl-imitation@yrlu

    在 Python/Tensorflow 中实现逆强化学习 (IRL) 算法。包含 Deep MaxEnt、MaxEnt、LPIRL

    681+0近 7 天星标变化
  • RosettaStone@utilForever

    使用 C++ 并结合部分强化学习(Reinforcement Learning)的炉石传说模拟器

    680+0近 7 天星标变化
  • BenchMARL@facebookresearch

    BenchMARL 是一个用于多智能体强化学习 (MARL) 基准测试的库。BenchMARL 能够快速比较不同的 MARL 算法、任务与模型,同时坚守其两大核心原则:可重现性与标准化。

    659+5近 7 天星标变化
  • 长思维链推理的最新进展

    647-1近 7 天星标变化
  • WebShop@princeton-nlp

    [NeurIPS 2022] 🛒WebShop:迈向具备基础语言代理的可扩展真实世界网页互动

    590+1近 7 天星标变化
  • 四足机器人的 ROS2-Control 实现,包含模拟到现实(sim2real)功能。

    568+3近 7 天星标变化
  • Meta Agents Research Environments 是一个综合平台,旨在评估动态、真实场景中的 AI 代理。与静态基准测试不同,此平台引入了不断演进的环境,代理必须随着新信息的出现调整策略,以反映现实世界的挑战。

    551+1近 7 天星标变化
  • morl-baselines@LucasAlegre

    多目标强化学习算法实现。

    533+0近 7 天星标变化
  • DeepThinkVLA@OpenBMB

    DeepThinkVLA:增强视觉-语言-动作模型的推理能力

    528-1近 7 天星标变化
  • gem@axon-rl

    代理型 LLM 的训练环境

    506+0近 7 天星标变化
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    502+1近 7 天星标变化
← 返回主题列表