跳到主要內容
buildradar
登入
主題 · reinforcement-learning

reinforcement-learning

標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。

共 305 個專案
  • DI-drive@opendilab

    用於自動駕駛模擬的決策智慧平台。

    638+0近 7 天星數變化
  • mlimpl@vincen-github

    這個儲存庫收集了一些封裝機器學習領域常用演算法的程式碼。大多數基於 Numpy、Pandas 或 Torch。您可以參考此儲存庫加深對相關模型與演算法的理解,或進行修改以取得屬於您自己的自訂程式碼。

    635+0近 7 天星數變化
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) 與 AutoTool (ICML 2026),DemyAgent:用於 LLM 與 Agent 場景的開源強化學習

    634+4近 7 天星數變化
  • ma-gym@koulanurag

    基於 OpenAI gym 的多代理環境集合。

    633+0近 7 天星數變化
  • virtualhome@xavierpuigf

    執行 VirtualHome(多 Agent 家庭模擬器)的 API

    632+2近 7 天星數變化
  • robohive@vikashplus

    用於機器人學習的統一框架

    631+0近 7 天星數變化
  • 在 Unitree Go2 上部署 walk-these-ways 專案

    624+2近 7 天星數變化
  • VisualThinker-R1-Zero@turningpoint-ai

    探索 2B 模型上的多模態「Aha 時刻」

    623+0近 7 天星數變化
  • DiffPhysDrone@HenryHuYu

    發表於 Nature Machine Intelligence!首個基於可微分物理訓練的真實機器人(四軸飛行器)。

    615+6近 7 天星數變化
  • ML-2021-notes@chsiang426

    臺灣大學 (NTU) 李宏毅教授「機器學習 (Machine Learning) 2021 Spring」課程筆記

    603+2近 7 天星數變化
  • recogdrive@xiaomi-research

    [ICLR 2026] ReCogDrive:用於端到端自動駕駛的強化認知框架

    602+4近 7 天星數變化
  • Relax@redai-studio

    用於大規模全模態後訓練的非同步強化學習引擎。

    598+13近 7 天星數變化
  • 強化學習相關論文,包含經典論文與頂級會議的最新論文

    595+0近 7 天星數變化
  • 關於影片生成強化學習的精選論文列表。

    593+2近 7 天星數變化
  • Graph-R1@LHRLAB

    [ICML 2026] "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning" 官方資源

    591+0近 7 天星數變化
  • AAAI-2024-Papers@DmitryRyumin

    AAAI 2024 論文集:探索頂尖人工智慧會議發表的創新研究論文。整合程式碼實作以利理解。⭐ 透過此儲存庫體驗人工智慧的前沿進展!

    591-1近 7 天星數變化
  • crafter@danijar

    評測 AI Agent 能力範圍的基準測試

    588+2近 7 天星數變化
  • safety-gymnasium@PKU-Alignment

    NeurIPS 2023:Safety-Gymnasium:一個統一的安全強化學習基準測試

    581+2近 7 天星數變化
  • OmniDrones@btx0424
    578+4近 7 天星數變化
  • TextRL@voidful

    在 huggingface transformer 的任何生成模型(blommz-176B/bloom/gpt/bart/T5/MetaICL)上實作 ChatGPT RLHF(人類回饋強化學習)。

    564+0近 7 天星數變化
  • 自動駕駛(Carla)中的深度強化學習(PPO)[從零開始]

    563-1近 7 天星數變化
  • Meta Agents Research Environments 是一個綜合平台,旨在評估動態、真實場景中的 AI 代理。與靜態基準測試不同,此平台引入了不斷演進的環境,代理必須隨著新資訊的出現調整策略,以反映現實世界的挑戰。

    551+1近 7 天星數變化
  • awesome-ai@hades217

    精選的人工智慧資源列表(課程、工具、應用程式、開源專案)

    549+1近 7 天星數變化
  • flybody@TuragaLab

    MuJoCo 果蠅身體模型與運動強化學習任務

    544+6近 7 天星數變化
  • ReasonFlux@Gen-Verse

    [NeurIPS 2025 Spotlight] LLM 後訓練套件 — 包含 ReasonFlux、ReasonFlux-PRM 與 ReasonFlux-Coder

    542+0近 7 天星數變化
  • umi-on-legs@real-stanford

    UMI on Legs:透過以操作為中心的全身控制器實現移動操作策略

    539+3近 7 天星數變化
  • 精選來自 CalTech、Columbia、Berkeley、MIT 與 Stanford 的公開機器學習工程課程列表。

    535+0近 7 天星數變化
  • morl-baselines@LucasAlegre

    多目標強化學習演算法實作。

    533+0近 7 天星數變化
  • InterMimic@Sirui-Xu

    [CVPR 2025 Highlight] InterMimic:邁向基於物理的人機互動通用全身控制

    528+0近 7 天星數變化
  • 人形机器人运动智能论文、开源项目、产业与求职知识库

    525近 7 天星數變化
← 返回主題列表