rl
标记 rl 主题、收录中的开源项目,按星标数排序。
- #31
MobileGym:用于 Mobile GUI Agent 研究的可验证高并发模拟平台 · 浏览器里运行的安卓模拟器 · Browser-hosted Android Simulator · 可验证评估 · 可扩展的线上 RL 训练
★ 787+5近 7 天星标变化 - #32
Stable-Baselines3 的贡献套件 - 实验性强化学习(RL)代码
★ 736+1近 7 天星标变化 - #33
精选的蒙特卡洛树搜索论文及其实作列表。
★ 715+0近 7 天星标变化 - #34
基于真实全景图像进行强化学习的 AI 研究平台。
★ 713-1近 7 天星标变化 - #35★ 706+5近 7 天星标变化
- #36
在 Python/Tensorflow 中实现逆强化学习 (IRL) 算法。包含 Deep MaxEnt、MaxEnt、LPIRL
★ 681+0近 7 天星标变化 - #37
使用 C++ 并结合部分强化学习(Reinforcement Learning)的炉石传说模拟器
★ 680+0近 7 天星标变化 - #38
BenchMARL 是一个用于多智能体强化学习 (MARL) 基准测试的库。BenchMARL 能够快速比较不同的 MARL 算法、任务与模型,同时坚守其两大核心原则:可重现性与标准化。
★ 659+5近 7 天星标变化 - #39
长思维链推理的最新进展
★ 647-1近 7 天星标变化 - #40★ 590+1近 7 天星标变化
- #41
四足机器人的 ROS2-Control 实现,包含模拟到现实(sim2real)功能。
★ 568+3近 7 天星标变化 - #42
Meta Agents Research Environments 是一个综合平台,旨在评估动态、真实场景中的 AI 代理。与静态基准测试不同,此平台引入了不断演进的环境,代理必须随着新信息的出现调整策略,以反映现实世界的挑战。
★ 551+1近 7 天星标变化 - #43
多目标强化学习算法实现。
★ 533+0近 7 天星标变化 - #44
DeepThinkVLA:增强视觉-语言-动作模型的推理能力
★ 528-1近 7 天星标变化 - #45★ 506+0近 7 天星标变化
- #46
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 502+1近 7 天星标变化