跳到主要内容
buildradar
登录
主题 · reinforcement-learning

reinforcement-learning

标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。

共 305 个项目
  • vowpal_wabbit@VowpalWabbit

    Vowpal Wabbit 是一套机器学习系统,通过在线学习、哈希、allreduce、reduction、learning2search、主动与互动式学习等技术推动机器学习前沿

    8,708+0近 7 天星标变化
  • pysc2@google-deepmind

    星际争霸 II 学习环境

    8,309+0近 7 天星标变化
  • PaLM-rlhf-pytorch@lucidrains

    在 PaLM 架构之上实现 RLHF(带人类反馈的强化学习)。基本上是 ChatGPT,但使用 PaLM。

    7,866+0近 7 天星标变化
  • maths-cs-ai-compendium@HenryNdubuaku

    通过这本非传统教材,成为破解 AI/ML 研究员/工程师,涵盖数学、计算与机器学习直观概念。

    7,400+0近 7 天星标变化
  • 多模态机器学习研究主题阅读清单

    6,926+0近 7 天星标变化
  • 收集 LLM 论文、博客与项目,聚焦 OpenAI o1 🍓 与推理技术

    6,902+0近 7 天星标变化
  • Practical_RL@yandexdataschool

    野外强化学习课程

    6,566+0近 7 天星标变化
  • 🔬 精选金融市场中的优秀 LLM 与深度学习策略与工具清单。

    6,475+0近 7 天星标变化
  • Mooncake@kvcache-ai

    Mooncake 是 Moonshot AI 提供的领先 LLM 服务 Kimi 的服务平台

    6,470+0近 7 天星标变化
  • 精选的自监督方法列表

    6,414+0近 7 天星标变化
  • PufferLib@PufferAI

    扩张强化学习

    6,321+0近 7 天星标变化
  • VLM-R1@om-ai-lab

    使用强化式 VLM 解决视觉理解问题。

    6,018+0近 7 天星标变化
  • rllm@rllm-org

    让大型语言模型的强化学习更普及

    5,813+0近 7 天星标变化
  • AReaL@areal-project

    LLM 基于代理应用的 RL Bridge,简单且灵活

    5,712+0近 7 天星标变化
  • open_spiel@google-deepmind

    OpenSpiel 是一个环境与算法集合,用于一般强化学习研究以及游戏中的搜索/规划

    5,452+0近 7 天星标变化
  • 一个开源四足机器人宠物框架,用于开发类似 Boston Dynamics 的四足机器人,适合 STEM、编码与机器人教育、IoT 机器人应用、AI 强化机器人服务、研究以及 DIY 机器人套件开发。

    5,246+0近 7 天星标变化
  • xtuner@InternLM

    为超大型 MoE 模型打造的下一代训练引擎

    5,188+0近 7 天星标变化
  • deep-reinforcement-learning@udacity

    Deep Reinforcement Learning Nanodegree 课程的仓库

    5,176+0近 7 天星标变化
  • EasyR1@hiyouga

    EasyR1:一个基于 veRL 的高效、可扩展、多模态 RL 训练框架。

    5,141+0近 7 天星标变化
  • reasoning-from-scratch@rasbt

    从零开始在 PyTorch 中实现推理 LLM,逐步说明

    5,138+0近 7 天星标变化
  • deep-rl-class@huggingface

    此仓库包含 Hugging Face 深度强化学习课程

    5,006+0近 7 天星标变化
  • LLM-RL-Visualized@changyeyu

    🌟100+ 原创 LLM / RL 原理图📚,《大模型算法》作者巨献!💥(100+ LLM/RL Algorithm Maps )

    4,838+0近 7 天星标变化
  • trlx@CarperAI

    一个使用 RLHF 的分散式语言模型训练仓库

    4,754+0近 7 天星标变化
  • RLinf@RLinf

    RLinf:面向具身与代理 AI 的强化学习基础设施

    4,705+0近 7 天星标变化
  • dm_control@google-deepmind

    Google DeepMind 的软件堆栈,用于物理模拟与强化学习环境,采用 MuJoCo

    4,681+0近 7 天星标变化
  • DouZero@kwai

    [ICML 2021] DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning | 斗地主 AI

    4,659+0近 7 天星标变化
  • alpha-zero-general@suragnair

    基于 AlphaZero 的干净实现,适用于任何框架的任何游戏 + 教学 + Othello/围棋/井字棋/四子棋 等

    4,512+0近 7 天星标变化
  • awesome-RLHF@opendilab

    一份经过精选的强化学习与人类反馈资源列表(持续更新)

    4,424+0近 7 天星标变化
  • ElegantRL@AI4Finance-Foundation

    大规模并行深度强化学习。🔥

    4,359+0近 7 天星标变化
  • hands-on-modern-rl@walkinglabs

    🚀 一个开源、实作导向的课程,弥合基础 RL 概念与 LLM 对齐、RLVR 及进阶代理系统之间的差距

    4,199+0近 7 天星标变化
← 返回主题列表