跳到主要內容
buildradar
Sign in
主題 · rl

rl

標記 rl 主題、收錄中的開源專案,依星數排序。

共 46 個專案
  • mobilegym@Purewhiter

    MobileGym:用於 Mobile GUI Agent 研究的可驗證高並行模擬平台 · 瀏覽器裡運行的安卓模擬器 · Browser-hosted Android Simulator · 可驗證評估 · 可擴展的線上 RL 訓練

    787+10近 7 天星數變化
  • stable-baselines3-contrib@Stable-Baselines-Team

    Stable-Baselines3 的貢獻套件 - 實驗性強化學習(RL)程式碼

    736+5近 7 天星數變化
  • 精選的蒙地卡羅樹搜尋論文及其實作列表。

    715+1近 7 天星數變化
  • Matterport3DSimulator@peteanderson80

    基於真實全景圖像進行強化學習的 AI 研究平台。

    713+1近 7 天星數變化
  • dr-tulu@rlresearch

    DR Tulu 的官方儲存庫:具備深度研究演進評分標準的強化學習

    706+4近 7 天星數變化
  • irl-imitation@yrlu

    在 Python/Tensorflow 中實作逆向強化學習 (IRL) 演算法。包含 Deep MaxEnt、MaxEnt、LPIRL

    681+2近 7 天星數變化
  • RosettaStone@utilForever

    使用 C++ 並結合部分強固學習(Reinforcement Learning)的爐石戰記模擬器

    680+1近 7 天星數變化
  • BenchMARL@facebookresearch

    BenchMARL 是一個用於多智能體強化學習 (MARL) 基準測試的函式庫。BenchMARL 能夠快速比較不同的 MARL 演算法、任務與模型,同時堅守其兩大核心原則:可重現性與標準化。

    659+2近 7 天星數變化
  • 長思考鏈推理的最新進展

    647-1近 7 天星數變化
  • WebShop@princeton-nlp

    [NeurIPS 2022] 🛒WebShop:邁向具備基礎語言代理的可擴展真實世界網頁互動

    590+3近 7 天星數變化
  • 四足機器人的 ROS2-Control 實作,包含模擬到現實(sim2real)功能。

    567+4近 7 天星數變化
  • Meta Agents Research Environments 是一個綜合平台,旨在評估動態、真實場景中的 AI 代理。與靜態基準測試不同,此平台引入了不斷演進的環境,代理必須隨著新資訊的出現調整策略,以反映現實世界的挑戰。

    551+4近 7 天星數變化
  • morl-baselines@LucasAlegre

    多目標強化學習演算法實作。

    533+1近 7 天星數變化
  • DeepThinkVLA@OpenBMB

    DeepThinkVLA:增強視覺-語言-動作模型的推理能力

    528+0近 7 天星數變化
  • gem@axon-rl

    代理型 LLM 的訓練環境

    506+1近 7 天星數變化
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    502近 7 天星數變化
← 返回主題列表