reinforcement-learning
標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。
- #271★ 638+0近 7 天星數變化
- #272
這個儲存庫收集了一些封裝機器學習領域常用演算法的程式碼。大多數基於 Numpy、Pandas 或 Torch。您可以參考此儲存庫加深對相關模型與演算法的理解,或進行修改以取得屬於您自己的自訂程式碼。
★ 635+0近 7 天星數變化 - #273
RLAnything (ICML 2026) 與 AutoTool (ICML 2026),DemyAgent:用於 LLM 與 Agent 場景的開源強化學習
★ 634+4近 7 天星數變化 - #274★ 633+0近 7 天星數變化
- #275
執行 VirtualHome(多 Agent 家庭模擬器)的 API
★ 632+2近 7 天星數變化 - #276★ 631+0近 7 天星數變化
- #277
在 Unitree Go2 上部署 walk-these-ways 專案
★ 624+2近 7 天星數變化 - #278
探索 2B 模型上的多模態「Aha 時刻」
★ 623+0近 7 天星數變化 - #279
發表於 Nature Machine Intelligence!首個基於可微分物理訓練的真實機器人(四軸飛行器)。
★ 615+6近 7 天星數變化 - #280
臺灣大學 (NTU) 李宏毅教授「機器學習 (Machine Learning) 2021 Spring」課程筆記
★ 603+2近 7 天星數變化 - #281
[ICLR 2026] ReCogDrive:用於端到端自動駕駛的強化認知框架
★ 602+4近 7 天星數變化 - #282★ 598+13近 7 天星數變化
- #283
強化學習相關論文,包含經典論文與頂級會議的最新論文
★ 595+0近 7 天星數變化 - #284
關於影片生成強化學習的精選論文列表。
★ 593+2近 7 天星數變化 - #285
[ICML 2026] "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning" 官方資源
★ 591+0近 7 天星數變化 - #286
AAAI 2024 論文集:探索頂尖人工智慧會議發表的創新研究論文。整合程式碼實作以利理解。⭐ 透過此儲存庫體驗人工智慧的前沿進展!
★ 591-1近 7 天星數變化 - #287★ 588+2近 7 天星數變化
- #288
NeurIPS 2023:Safety-Gymnasium:一個統一的安全強化學習基準測試
★ 581+2近 7 天星數變化 - #289★ 578+4近 7 天星數變化
- #290
在 huggingface transformer 的任何生成模型(blommz-176B/bloom/gpt/bart/T5/MetaICL)上實作 ChatGPT RLHF(人類回饋強化學習)。
★ 564+0近 7 天星數變化 - #291
自動駕駛(Carla)中的深度強化學習(PPO)[從零開始]
★ 563-1近 7 天星數變化 - #292
Meta Agents Research Environments 是一個綜合平台,旨在評估動態、真實場景中的 AI 代理。與靜態基準測試不同,此平台引入了不斷演進的環境,代理必須隨著新資訊的出現調整策略,以反映現實世界的挑戰。
★ 551+1近 7 天星數變化 - #293
精選的人工智慧資源列表(課程、工具、應用程式、開源專案)
★ 549+1近 7 天星數變化 - #294★ 544+6近 7 天星數變化
- #295
[NeurIPS 2025 Spotlight] LLM 後訓練套件 — 包含 ReasonFlux、ReasonFlux-PRM 與 ReasonFlux-Coder
★ 542+0近 7 天星數變化 - #296
UMI on Legs:透過以操作為中心的全身控制器實現移動操作策略
★ 539+3近 7 天星數變化 - #297
精選來自 CalTech、Columbia、Berkeley、MIT 與 Stanford 的公開機器學習工程課程列表。
★ 535+0近 7 天星數變化 - #298
多目標強化學習演算法實作。
★ 533+0近 7 天星數變化 - #299
[CVPR 2025 Highlight] InterMimic:邁向基於物理的人機互動通用全身控制
★ 528+0近 7 天星數變化 - #300
人形机器人运动智能论文、开源项目、产业与求职知识库
★ 525—近 7 天星數變化