rl
標記 rl 主題、收錄中的開源專案,依星數排序。
- #31
MobileGym:用於 Mobile GUI Agent 研究的可驗證高並行模擬平台 · 瀏覽器裡運行的安卓模擬器 · Browser-hosted Android Simulator · 可驗證評估 · 可擴展的線上 RL 訓練
★ 787+10近 7 天星數變化 - #32
Stable-Baselines3 的貢獻套件 - 實驗性強化學習(RL)程式碼
★ 736+5近 7 天星數變化 - #33
精選的蒙地卡羅樹搜尋論文及其實作列表。
★ 715+1近 7 天星數變化 - #34
基於真實全景圖像進行強化學習的 AI 研究平台。
★ 713+1近 7 天星數變化 - #35★ 706+4近 7 天星數變化
- #36
在 Python/Tensorflow 中實作逆向強化學習 (IRL) 演算法。包含 Deep MaxEnt、MaxEnt、LPIRL
★ 681+2近 7 天星數變化 - #37
使用 C++ 並結合部分強固學習(Reinforcement Learning)的爐石戰記模擬器
★ 680+1近 7 天星數變化 - #38
BenchMARL 是一個用於多智能體強化學習 (MARL) 基準測試的函式庫。BenchMARL 能夠快速比較不同的 MARL 演算法、任務與模型,同時堅守其兩大核心原則:可重現性與標準化。
★ 659+2近 7 天星數變化 - #39
長思考鏈推理的最新進展
★ 647-1近 7 天星數變化 - #40★ 590+3近 7 天星數變化
- #41
四足機器人的 ROS2-Control 實作,包含模擬到現實(sim2real)功能。
★ 567+4近 7 天星數變化 - #42
Meta Agents Research Environments 是一個綜合平台,旨在評估動態、真實場景中的 AI 代理。與靜態基準測試不同,此平台引入了不斷演進的環境,代理必須隨著新資訊的出現調整策略,以反映現實世界的挑戰。
★ 551+4近 7 天星數變化 - #43
多目標強化學習演算法實作。
★ 533+1近 7 天星數變化 - #44
DeepThinkVLA:增強視覺-語言-動作模型的推理能力
★ 528+0近 7 天星數變化 - #45★ 506+1近 7 天星數變化
- #46
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 502—近 7 天星數變化