reinforcement-learning
标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。
- #271★ 638+0近 7 天星标变化
- #272
这个仓库收集了一些封装机器学习领域常用算法的代码。大多数基于 Numpy、Pandas 或 Torch。您可以参考此仓库加深对相关模型与算法的理解,或进行修改以获取属于您自己的自定义代码。
★ 635+0近 7 天星标变化 - #273
RLAnything (ICML 2026) 与 AutoTool (ICML 2026),DemyAgent:用于 LLM 与 Agent 场景的开源强化学习
★ 634+4近 7 天星标变化 - #274★ 633+0近 7 天星标变化
- #275
运行 VirtualHome(多 Agent 家庭模拟器)的 API
★ 632+2近 7 天星标变化 - #276★ 631+0近 7 天星标变化
- #277
在 Unitree Go2 上部署 walk-these-ways 项目
★ 624+2近 7 天星标变化 - #278
探索 2B 模型上的多模态“Aha 时刻”
★ 623+0近 7 天星标变化 - #279
发表于 Nature Machine Intelligence!首个基于可微分物理训练的真实机器人(四轴飞行器)。
★ 615+6近 7 天星标变化 - #280
[ICLR 2026] ReCogDrive:用于端到端自动驾驶的强化认知框架
★ 604+4近 7 天星标变化 - #281
台湾大学 (NTU) 李宏毅教授“机器学习 (Machine Learning) 2021 Spring”课程笔记
★ 603+2近 7 天星标变化 - #282★ 601+13近 7 天星标变化
- #283
强化学习相关论文,包含经典论文与顶级会议的最新论文
★ 597+0近 7 天星标变化 - #284
关于视频生成强化学习的精选论文列表。
★ 593+2近 7 天星标变化 - #285
[ICML 2026] "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning" 官方资源
★ 592+0近 7 天星标变化 - #286
AAAI 2024 论文集:探索顶尖人工智能会议发表的创新研究论文。整合代码实现以利理解。⭐ 通过此存储库体验人工智能的前沿进展!
★ 591-1近 7 天星标变化 - #287★ 588+2近 7 天星标变化
- #288
NeurIPS 2023:Safety-Gymnasium:一个统一的安全强化学习基准测试
★ 581+2近 7 天星标变化 - #289★ 578+4近 7 天星标变化
- #290
在 huggingface transformer 的任何生成模型(blommz-176B/bloom/gpt/bart/T5/MetaICL)上实现 ChatGPT RLHF(人类反馈强化学习)。
★ 564+0近 7 天星标变化 - #291
自动驾驶(Carla)中的深度强化学习(PPO)[从零开始]
★ 563-1近 7 天星标变化 - #292
Meta Agents Research Environments 是一个综合平台,旨在评估动态、真实场景中的 AI 代理。与静态基准测试不同,此平台引入了不断演进的环境,代理必须随着新信息的出现调整策略,以反映现实世界的挑战。
★ 551+1近 7 天星标变化 - #293
精选的人工智能资源列表(课程、工具、应用程序、开源项目)
★ 549+1近 7 天星标变化 - #294★ 545+6近 7 天星标变化
- #295
[NeurIPS 2025 Spotlight] LLM 后训练套件 — 包含 ReasonFlux、ReasonFlux-PRM 与 ReasonFlux-Coder
★ 542+0近 7 天星标变化 - #296
UMI on Legs:通过以操作为中心的全身控制器实现移动操作策略
★ 539+3近 7 天星标变化 - #297
精选来自 CalTech、Columbia、Berkeley、MIT 与 Stanford 的公开机器学习工程课程列表。
★ 535+0近 7 天星标变化 - #298
多目标强化学习算法实现。
★ 533+0近 7 天星标变化 - #299
[CVPR 2025 Highlight] InterMimic:迈向基于物理的人机交互通用全身控制
★ 528+0近 7 天星标变化 - #300
人形机器人运动智能论文、开源项目、产业与求职知识库
★ 525—近 7 天星标变化