reinforcement-learning
标记 reinforcement-learning 主题、收录中的开源项目,按星标数排序。
- #241★ 766+1近 7 天星标变化
- #242
关于构建自主代理的最新论文集合。包含两个主题:基于 RL 的代理与基于 LLM 的代理。
★ 760+2近 7 天星标变化 - #243★ 737+1近 7 天星标变化
- #244
Stable-Baselines3 的贡献套件 - 实验性强化学习(RL)代码
★ 736+1近 7 天星标变化 - #245
这是一个关于无人机深度强化学习自主避障算法的项目。
★ 730+0近 7 天星标变化 - #246★ 730+1近 7 天星标变化
- #247★ 729+2近 7 天星标变化
- #248★ 727+0近 7 天星标变化
- #249
用于在 Python 中进行扑克 AI 开发的扑克引擎
★ 723+2近 7 天星标变化 - #250
精选的探索式强化学习 (RL) 资源清单(持续更新)
★ 723+0近 7 天星标变化 - #251
基于 keras-rl 与强化学习的德州扑克 OpenAI Gym 环境。包含胜率计算的虚拟渲染与蒙特卡洛方法。
★ 722+0近 7 天星标变化 - #252
论文“Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach”的代码。
★ 722+1近 7 天星标变化 - #253
[COLM’25] DeepRetrieval — 🔥 通过具备检索结果的 RLVR 训练 Search Agent
★ 719+2近 7 天星标变化 - #254
精选的蒙特卡洛树搜索论文及其实作列表。
★ 715+0近 7 天星标变化 - #255
基于真实全景图像进行强化学习的 AI 研究平台。
★ 713-1近 7 天星标变化 - #256
视觉语言模型论文与模型的顶级前端收集与调查 GitHub 仓库。持续更新中。
★ 710+5近 7 天星标变化 - #257
基于模型预测控制的强化学习
★ 710+1近 7 天星标变化 - #258★ 709+0近 7 天星标变化
- #259★ 695+3近 7 天星标变化
- #260
用于在 Flow-Matching 模型中轻松进行强化学习的统一框架
★ 695+8近 7 天星标变化 - #261
在 Python/Tensorflow 中实现逆强化学习 (IRL) 算法。包含 Deep MaxEnt、MaxEnt、LPIRL
★ 681+0近 7 天星标变化 - #262
使用 C++ 并结合部分强化学习(Reinforcement Learning)的炉石传说模拟器
★ 680+0近 7 天星标变化 - #263
用于 MDP 和 POMDP 的 C++ 框架,并提供 Python 绑定
★ 671+0近 7 天星标变化 - #264
BenchMARL 是一个用于多智能体强化学习 (MARL) 基准测试的库。BenchMARL 能够快速比较不同的 MARL 算法、任务与模型,同时坚守其两大核心原则:可重现性与标准化。
★ 659+5近 7 天星标变化 - #265
用于构建深度强化学习智能体的 PyTorch 库
★ 657+0近 7 天星标变化 - #266
数据科学项目的完整生命周期
★ 653+0近 7 天星标变化 - #267
适用于 Julia 的强化学习套件。
★ 652-1近 7 天星标变化 - #268
长思维链推理的最新进展
★ 647-1近 7 天星标变化 - #269★ 645+3近 7 天星标变化
- #270
“Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement”项目页面
★ 640+1近 7 天星标变化