reinforcement-learning
标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。
- #91
🤖 机器学习暑期学校指南
★ 3,033+0近 7 天星标变化 - #92★ 3,026+0近 7 天星标变化
- #93
深度学习与深度强化学习研究论文及部分代码
★ 3,026+0近 7 天星标变化 - #94★ 2,960+0近 7 天星标变化
- #95★ 2,919+0近 7 天星标变化
- #96
用于 Stable Baselines3 强化学习智能体的训练框架,包含超参数优化与预训练智能体。
★ 2,873+0近 7 天星标变化 - #97
用 100 行代码实现论文
★ 2,870+0近 7 天星标变化 - #98
MuZero
★ 2,865+0近 7 天星标变化 - #99
简单且全面的 TensorFlow 教程
★ 2,841+0近 7 天星标变化 - #100★ 2,806+0近 7 天星标变化
- #101★ 2,786+0近 7 天星标变化
- #102★ 2,657+0近 7 天星标变化
- #103
PPO x Family DRL 教程课程(决策智能入门级公开课:8节课帮你盘清算法理论,理顺代码逻辑,玩转决策AI应用实践 )
★ 2,616+0近 7 天星标变化 - #104
用于工业级搜索、推荐和广告的精选深度学习论文。专注于 Embedding、Matching、Pre-Ranking、Ranking、Post Ranking、Relevance、LLM 和 RL。请引用我们的论文 "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026)。
★ 2,589+0近 7 天星标变化 - #105★ 2,586+0近 7 天星标变化
- #106
强大推理能力 LLM 的教学、调查与指南资源集合
★ 2,533+0近 7 天星标变化 - #107
《Reinforcement Learning: An Introduction》解答
★ 2,433+0近 7 天星标变化 - #108★ 2,395+0近 7 天星标变化
- #109
最简单、灵活且完整的 OpenAI Gym 交易环境(经 OpenAI Gym 批准)
★ 2,387+0近 7 天星标变化 - #110
在 PyTorch 中最小化实现截断目标的近端策略优化(PPO)
★ 2,381+0近 7 天星标变化 - #111
ProtoMotions 是一个用于训练物理模拟数字人类与人形机器人的 GPU 加速模拟与学习框架。
★ 2,359+0近 7 天星标变化 - #112
ICCV2019 - 利用基于模型的深度强化学习学习绘画
★ 2,308+0近 7 天星标变化 - #113★ 2,293+0近 7 天星标变化
- #114★ 2,280+0近 7 天星标变化
- #115
verl-agent 是 veRL 的扩展,专为通过强化学习 (RL) 训练 LLM/VLM Agent 所设计。verl-agent 也是论文 "Group-in-Group Policy Optimization for LLM Agent Training" 的官方代码。
★ 2,274+0近 7 天星标变化 - #116
推荐、广告与搜索领域的工业界经典与最新前沿论文集合。
★ 2,188+0近 7 天星标变化 - #117
用于四轴飞行器控制的单一与多代理强化学习的 PyBullet Gymnasium 环境
★ 2,119+0近 7 天星标变化 - #118★ 2,107+0近 7 天星标变化
- #119
DIAMOND (DIffusion As a Model Of eNvironment Dreams) 是一种在扩散世界模型中训练的强化学习智能体。NeurIPS 2024 Spotlight。
★ 2,100+0近 7 天星标变化 - #120★ 2,065+0近 7 天星标变化