跳到主要内容
buildradar
登录
主题 · reinforcement-learning

reinforcement-learning

标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。

共 305 个项目
  • DI-drive@opendilab

    用于自动驾驶模拟的决策智能平台。

    638+0近 7 天星标变化
  • mlimpl@vincen-github

    这个仓库收集了一些封装机器学习领域常用算法的代码。大多数基于 Numpy、Pandas 或 Torch。您可以参考此仓库加深对相关模型与算法的理解,或进行修改以获取属于您自己的自定义代码。

    635+0近 7 天星标变化
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) 与 AutoTool (ICML 2026),DemyAgent:用于 LLM 与 Agent 场景的开源强化学习

    634+4近 7 天星标变化
  • ma-gym@koulanurag

    基于 OpenAI gym 的多智能体环境集合。

    633+0近 7 天星标变化
  • virtualhome@xavierpuigf

    运行 VirtualHome(多 Agent 家庭模拟器)的 API

    632+2近 7 天星标变化
  • robohive@vikashplus

    用于机器人学习的统一框架

    631+0近 7 天星标变化
  • 在 Unitree Go2 上部署 walk-these-ways 项目

    624+2近 7 天星标变化
  • VisualThinker-R1-Zero@turningpoint-ai

    探索 2B 模型上的多模态“Aha 时刻”

    623+0近 7 天星标变化
  • DiffPhysDrone@HenryHuYu

    发表于 Nature Machine Intelligence!首个基于可微分物理训练的真实机器人(四轴飞行器)。

    615+6近 7 天星标变化
  • recogdrive@xiaomi-research

    [ICLR 2026] ReCogDrive:用于端到端自动驾驶的强化认知框架

    604+4近 7 天星标变化
  • ML-2021-notes@chsiang426

    台湾大学 (NTU) 李宏毅教授“机器学习 (Machine Learning) 2021 Spring”课程笔记

    603+2近 7 天星标变化
  • Relax@redai-studio

    用于大规模全模态后训练的异步强化学习引擎。

    601+13近 7 天星标变化
  • 强化学习相关论文,包含经典论文与顶级会议的最新论文

    597+0近 7 天星标变化
  • 关于视频生成强化学习的精选论文列表。

    593+2近 7 天星标变化
  • Graph-R1@LHRLAB

    [ICML 2026] "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning" 官方资源

    592+0近 7 天星标变化
  • AAAI-2024-Papers@DmitryRyumin

    AAAI 2024 论文集:探索顶尖人工智能会议发表的创新研究论文。整合代码实现以利理解。⭐ 通过此存储库体验人工智能的前沿进展!

    591-1近 7 天星标变化
  • crafter@danijar

    评测 AI Agent 能力范围的基准测试

    588+2近 7 天星标变化
  • safety-gymnasium@PKU-Alignment

    NeurIPS 2023:Safety-Gymnasium:一个统一的安全强化学习基准测试

    581+2近 7 天星标变化
  • OmniDrones@btx0424
    578+4近 7 天星标变化
  • TextRL@voidful

    在 huggingface transformer 的任何生成模型(blommz-176B/bloom/gpt/bart/T5/MetaICL)上实现 ChatGPT RLHF(人类反馈强化学习)。

    564+0近 7 天星标变化
  • 自动驾驶(Carla)中的深度强化学习(PPO)[从零开始]

    563-1近 7 天星标变化
  • Meta Agents Research Environments 是一个综合平台,旨在评估动态、真实场景中的 AI 代理。与静态基准测试不同,此平台引入了不断演进的环境,代理必须随着新信息的出现调整策略,以反映现实世界的挑战。

    551+1近 7 天星标变化
  • awesome-ai@hades217

    精选的人工智能资源列表(课程、工具、应用程序、开源项目)

    549+1近 7 天星标变化
  • flybody@TuragaLab

    MuJoCo 果蝇身体模型与运动强化学习任务

    545+6近 7 天星标变化
  • ReasonFlux@Gen-Verse

    [NeurIPS 2025 Spotlight] LLM 后训练套件 — 包含 ReasonFlux、ReasonFlux-PRM 与 ReasonFlux-Coder

    542+0近 7 天星标变化
  • umi-on-legs@real-stanford

    UMI on Legs:通过以操作为中心的全身控制器实现移动操作策略

    539+3近 7 天星标变化
  • 精选来自 CalTech、Columbia、Berkeley、MIT 与 Stanford 的公开机器学习工程课程列表。

    535+0近 7 天星标变化
  • morl-baselines@LucasAlegre

    多目标强化学习算法实现。

    533+0近 7 天星标变化
  • InterMimic@Sirui-Xu

    [CVPR 2025 Highlight] InterMimic:迈向基于物理的人机交互通用全身控制

    528+0近 7 天星标变化
  • 人形机器人运动智能论文、开源项目、产业与求职知识库

    525近 7 天星标变化
← 返回主题列表