跳到主要内容
buildradar
登录
主题 · reinforcement-learning

reinforcement-learning

标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。

共 305 个项目
  • 超级马里奥兄弟的异步优势演员-评论家(A3C)算法

    1,111+0近 7 天星标变化
  • purejaxrl@luchris429

    极速的端到端 Jax RL 实现

    1,103+2近 7 天星标变化
  • skrl@Toni-SM

    模块化强化学习(RL)库(使用 PyTorch、JAX 与 NVIDIA Warp 实现),支持 Gymnasium/Gym、NVIDIA Isaac Lab、MuJoCo Playground 等环境。

    1,095+0近 7 天星标变化
  • DexterousHands@PKU-MARL

    这是一个通过 Isaac Gym 提供双手灵巧操作任务的库。

    1,094+3近 7 天星标变化
  • xuance@agi-brain

    XuanCe:一个全面且统一的深度强化学习库

    1,086+4近 7 天星标变化
  • 离线强化学习 (offline-rl) 算法索引。

    1,078+0近 7 天星标变化
  • Stable-Retro@Farama-Foundation

    gym-retro 的分支版本,包含额外的游戏、模拟器与支持的平台

    1,077+398近 7 天星标变化
  • sumo-rl@LucasAlegre

    使用 SUMO 进行交通信号控制的强化学习环境。兼容于 Gymnasium、PettingZoo 以及热门的 RL 库。

    1,075+2近 7 天星标变化
  • Books@Rishabh-creator601

    各个编程领域的书籍 / PDF / EPUB。阅读、成长并享受 😊😊😊😊

    1,066+0近 7 天星标变化
  • 掌握 AI/ML/DL/CV 的必备指南

    1,063+0近 7 天星标变化
  • judgeval@JudgmentLabs

    面向 Agent 的持续改进栈。我们的环境数据与评估为 Agent 的改进和监控提供动力。

    1,060+1近 7 天星标变化
  • Online-3D-BPP-PCT@alexfrom0815

    “Learning Efficient Online 3D Bin Packing on Packing Configuration Trees”的代码实现。我们提出通过在分层装箱配置树上进行学习,来增强在线三维装箱问题 (BPP) 的实际适用性,这使得深度强化学习 (DRL) 模型能够轻松应对实际限制,即使在连续解空间中也能表现良好。

    1,047+1近 7 天星标变化
  • Agent工程师最全学习路径 · 从零精通 AI 工程 · 20 阶段 503 课 · 中文全量翻译 + 配套站点 + 动画讲解视频 · 如何成为 AI Agent 工程师的修成指南

    1,047+21近 7 天星标变化
  • GPTSwarm@metauto-ai

    🐝 通过 RL / 提示词优化实现的第一批自我改进 Agent

    1,043+1近 7 天星标变化
  • rl-tools@rl-tools

    最快速的深度强化学习库

    1,033+1近 7 天星标变化
  • rl-book@ZhiqingXiao

    《Reinforcement Learning: Theory and Python Implementation》一书的源代码。

    1,033+1近 7 天星标变化
  • rl-mpc-locomotion@silvery107

    用于四足机器人 locomotion MPC 控制的深度强化学习

    1,024+2近 7 天星标变化
  • sample-factory@alex-petrenko

    高吞吐量同步与异步强化学习

    1,022+0近 7 天星标变化
  • DeepRec@imsheridan

    推荐、广告工业界经典以及最前沿的论文、资料集合

    1,016+0近 7 天星标变化
  • overcooked_ai@HumanCompatibleAI

    一个用于完全协同之人机协作性能的基准测试环境。

    1,003+3近 7 天星标变化
  • verl-omni@verl-project

    针对扩散与全能模型的多模态 RL 训练框架

    983+49近 7 天星标变化
  • 多智能体强化学习的精彩游戏 AI 素材

    980+1近 7 天星标变化
  • Step-Audio-EditX@stepfun-ai

    强大的 3B 参数、基于 LLM 的强化学习音频编辑模型,擅长编辑情感、说话风格与副语言学,并具备强大的零样本文本转语音功能

    973+1近 7 天星标变化
  • Gymnasium-Robotics@Farama-Foundation

    用于强化学习的机器人模拟环境集合

    963+0近 7 天星标变化
  • 机器学习开源大学

    955+0近 7 天星标变化
  • 使用生成式 AI 与深度学习进行分子与材料设计的列表。

    952+1近 7 天星标变化
  • AgileRL@AgileRL

    以 RLOps 简化强化学习。搭载最先进的 RL 算法与工具,通过进化式超参数优化实现快 10 倍的训练速度。

    951+3近 7 天星标变化
  • GibsonEnv@StanfordVL

    Gibson 环境:具身代理的真实世界感知

    947+0近 7 天星标变化
  • tdmpc2@nicklashansen

    “TD-MPC2: Scalable, Robust World Models for Continuous Control”的代码

    946+6近 7 天星标变化
  • Shimmy@Farama-Foundation

    PettingZoo and Gymnasium bindings for popular reinforcement learning environments outside of Farama

    945近 7 天星标变化
← 返回主题列表