reinforcement-learning
标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。
- #31
Vowpal Wabbit 是一套机器学习系统,通过在线学习、哈希、allreduce、reduction、learning2search、主动与互动式学习等技术推动机器学习前沿
★ 8,708+0近 7 天星标变化 - #32★ 8,309+0近 7 天星标变化
- #33
在 PaLM 架构之上实现 RLHF(带人类反馈的强化学习)。基本上是 ChatGPT,但使用 PaLM。
★ 7,866+0近 7 天星标变化 - #34
通过这本非传统教材,成为破解 AI/ML 研究员/工程师,涵盖数学、计算与机器学习直观概念。
★ 7,400+0近 7 天星标变化 - #35
多模态机器学习研究主题阅读清单
★ 6,926+0近 7 天星标变化 - #36
收集 LLM 论文、博客与项目,聚焦 OpenAI o1 🍓 与推理技术
★ 6,902+0近 7 天星标变化 - #37
野外强化学习课程
★ 6,566+0近 7 天星标变化 - #38
🔬 精选金融市场中的优秀 LLM 与深度学习策略与工具清单。
★ 6,475+0近 7 天星标变化 - #39★ 6,470+0近 7 天星标变化
- #40
精选的自监督方法列表
★ 6,414+0近 7 天星标变化 - #41★ 6,321+0近 7 天星标变化
- #42★ 6,018+0近 7 天星标变化
- #43★ 5,813+0近 7 天星标变化
- #44★ 5,712+0近 7 天星标变化
- #45
OpenSpiel 是一个环境与算法集合,用于一般强化学习研究以及游戏中的搜索/规划
★ 5,452+0近 7 天星标变化 - #46
一个开源四足机器人宠物框架,用于开发类似 Boston Dynamics 的四足机器人,适合 STEM、编码与机器人教育、IoT 机器人应用、AI 强化机器人服务、研究以及 DIY 机器人套件开发。
★ 5,246+0近 7 天星标变化 - #47★ 5,188+0近 7 天星标变化
- #48
Deep Reinforcement Learning Nanodegree 课程的仓库
★ 5,176+0近 7 天星标变化 - #49★ 5,141+0近 7 天星标变化
- #50
从零开始在 PyTorch 中实现推理 LLM,逐步说明
★ 5,138+0近 7 天星标变化 - #51
此仓库包含 Hugging Face 深度强化学习课程
★ 5,006+0近 7 天星标变化 - #52
🌟100+ 原创 LLM / RL 原理图📚,《大模型算法》作者巨献!💥(100+ LLM/RL Algorithm Maps )
★ 4,838+0近 7 天星标变化 - #53★ 4,754+0近 7 天星标变化
- #54★ 4,705+0近 7 天星标变化
- #55
Google DeepMind 的软件堆栈,用于物理模拟与强化学习环境,采用 MuJoCo
★ 4,681+0近 7 天星标变化 - #56
[ICML 2021] DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning | 斗地主 AI
★ 4,659+0近 7 天星标变化 - #57
基于 AlphaZero 的干净实现,适用于任何框架的任何游戏 + 教学 + Othello/围棋/井字棋/四子棋 等
★ 4,512+0近 7 天星标变化 - #58
一份经过精选的强化学习与人类反馈资源列表(持续更新)
★ 4,424+0近 7 天星标变化 - #59★ 4,359+0近 7 天星标变化
- #60
🚀 一个开源、实作导向的课程,弥合基础 RL 概念与 LLM 对齐、RLVR 及进阶代理系统之间的差距
★ 4,199+0近 7 天星标变化