跳到主要内容
buildradar
登录
主题 · reinforcement-learning

reinforcement-learning

标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。

共 305 个项目
  • awesome-mlss@awesome-mlss

    🤖 机器学习暑期学校指南

    3,033+0近 7 天星标变化
  • agents@tensorflow

    TF-Agents:一个可靠、可扩展且易于使用的 TensorFlow 库,用于上下文赛局(Contextual Bandits)和强化学习

    3,026+0近 7 天星标变化
  • 深度学习与深度强化学习研究论文及部分代码

    3,026+0近 7 天星标变化
  • mjlab@mujocolab

    基于 MuJoCo-Warp 的 Isaac Lab API,用于强化学习和机器人研究

    2,960+0近 7 天星标变化
  • openarm@enactic

    用于物理 AI 研究与在富接触环境中部署的完全开源人形机械手臂。

    2,919+0近 7 天星标变化
  • 用于 Stable Baselines3 强化学习智能体的训练框架,包含超参数优化与预训练智能体。

    2,873+0近 7 天星标变化
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    用 100 行代码实现论文

    2,870+0近 7 天星标变化
  • muzero-general@werner-duvaud

    MuZero

    2,865+0近 7 天星标变化
  • easy-tensorflow@easy-tensorflow

    简单且全面的 TensorFlow 教程

    2,841+0近 7 天星标变化
  • YC-Killer@sahibzada-allahyar

    企业级 AI 代理(Agent)库,旨在普及人工智能,并为估值过高的 Y Combinator 初创公司提供免费、开源的替代方案。

    2,806+0近 7 天星标变化
  • RAGEN@mll-lab-nu

    RAGEN 利用强化学习在交互式随机环境中训练 LLM 推理 Agent。

    2,786+0近 7 天星标变化
  • mctx@google-deepmind

    在 JAX 中实现的 蒙特卡洛树搜索。

    2,657+0近 7 天星标变化
  • PPOxFamily@opendilab

    PPO x Family DRL 教程课程(决策智能入门级公开课:8节课帮你盘清算法理论,理顺代码逻辑,玩转决策AI应用实践 )

    2,616+0近 7 天星标变化
  • 用于工业级搜索、推荐和广告的精选深度学习论文。专注于 Embedding、Matching、Pre-Ranking、Ranking、Post Ranking、Relevance、LLM 和 RL。请引用我们的论文 "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026)。

    2,589+0近 7 天星标变化
  • robosuite@ARISE-Initiative

    robosuite:用于机器人学习的模块化模拟框架与基准测试

    2,586+0近 7 天星标变化
  • 强大推理能力 LLM 的教学、调查与指南资源集合

    2,533+0近 7 天星标变化
  • 《Reinforcement Learning: An Introduction》解答

    2,433+0近 7 天星标变化
  • RL4LMs@allenai

    一个用于根据人类偏好微调语言模型的模块化 RL 库

    2,395+0近 7 天星标变化
  • gym-anytrading@AminHP

    最简单、灵活且完整的 OpenAI Gym 交易环境(经 OpenAI Gym 批准)

    2,387+0近 7 天星标变化
  • PPO-PyTorch@nikhilbarhate99

    在 PyTorch 中最小化实现截断目标的近端策略优化(PPO)

    2,381+0近 7 天星标变化
  • ProtoMotions@NVlabs

    ProtoMotions 是一个用于训练物理模拟数字人类与人形机器人的 GPU 加速模拟与学习框架。

    2,359+0近 7 天星标变化
  • ICCV2019 - 利用基于模型的深度强化学习学习绘画

    2,308+0近 7 天星标变化
  • drl-zh@alessiodm

    深度强化学习:从零到专家!

    2,293+0近 7 天星标变化
  • MimicKit@xbpeng

    用于训练控制器的轻量级动作模仿方法套件。

    2,280+0近 7 天星标变化
  • verl-agent@langfengQ

    verl-agent 是 veRL 的扩展,专为通过强化学习 (RL) 训练 LLM/VLM Agent 所设计。verl-agent 也是论文 "Group-in-Group Policy Optimization for LLM Agent Training" 的官方代码。

    2,274+0近 7 天星标变化
  • RecSysPapers@tangxyw

    推荐、广告与搜索领域的工业界经典与最新前沿论文集合。

    2,188+0近 7 天星标变化
  • gym-pybullet-drones@learnsyslab

    用于四轴飞行器控制的单一与多代理强化学习的 PyBullet Gymnasium 环境

    2,119+0近 7 天星标变化
  • ASAP@LeCAR-Lab

    [RSS 2025] “ASAP:对齐模拟与现实世界物理以学习具备灵活性的人形机器人全身技能”

    2,107+0近 7 天星标变化
  • diamond@eloialonso

    DIAMOND (DIffusion As a Model Of eNvironment Dreams) 是一种在扩散世界模型中训练的强化学习智能体。NeurIPS 2024 Spotlight。

    2,100+0近 7 天星标变化
  • ViZDoom@Farama-Foundation

    基于 1993 年游戏 Doom 的强化学习环境 :godmode:

    2,065+0近 7 天星标变化
← 返回主题列表