跳到主要內容
buildradar
登入
主題 · reinforcement-learning

reinforcement-learning

標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。

共 305 個專案
  • awesome-mlss@awesome-mlss

    🤖 機器學習暑期學校指南

    3,033+0近 7 天星數變化
  • agents@tensorflow

    TF-Agents:一個可靠、可擴展且易於使用的 TensorFlow 庫,用於上下文賽局(Contextual Bandits)和強化學習

    3,026+0近 7 天星數變化
  • 深度學習與深度強化學習研究論文及部分程式碼

    3,026+0近 7 天星數變化
  • mjlab@mujocolab

    基於 MuJoCo-Warp 的 Isaac Lab API,用於強化學習與機器人研究

    2,960+0近 7 天星數變化
  • openarm@enactic

    用於物理 AI 研究與在富接觸環境中部署的完全開源人形機械手臂。

    2,919+0近 7 天星數變化
  • 用於 Stable Baselines3 強化學習代理的訓練框架,包含超參數優化與預訓練代理。

    2,873+0近 7 天星數變化
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    用 100 行程式碼實作論文

    2,870+0近 7 天星數變化
  • muzero-general@werner-duvaud

    MuZero

    2,865+0近 7 天星數變化
  • easy-tensorflow@easy-tensorflow

    簡單且全面的 TensorFlow 教學

    2,841+0近 7 天星數變化
  • YC-Killer@sahibzada-allahyar

    企業級 AI 代理(Agent)庫,旨在普及人工智慧,並為估值過高的 Y Combinator 新創公司提供免費、開源的替代方案。

    2,806+0近 7 天星數變化
  • RAGEN@mll-lab-nu

    RAGEN 利用強化學習在互動式隨機環境中訓練 LLM 推理 Agent。

    2,786+0近 7 天星數變化
  • mctx@google-deepmind

    在 JAX 中實現的 蒙地卡羅樹搜尋。

    2,657+0近 7 天星數變化
  • PPOxFamily@opendilab

    PPO x Family DRL 教程課程(決策智能入門級公開課:8節課幫你盤清算法理論,理順代碼邏輯,玩轉決策AI應用實踐 )

    2,616+0近 7 天星數變化
  • 用於工業級搜尋、推薦和廣告的精選深度學習論文。專注於 Embedding、Matching、Pre-Ranking、Ranking、Post Ranking、Relevance、LLM 和 RL。請引用我們的論文 "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026)。

    2,589+0近 7 天星數變化
  • robosuite@ARISE-Initiative

    robosuite:用於機器人學習的模組化模擬框架與基準測試

    2,586+0近 7 天星數變化
  • 強大推理能力 LLM 的教學、調查與指南資源集合

    2,533+0近 7 天星數變化
  • 《Reinforcement Learning: An Introduction》解答

    2,433+0近 7 天星數變化
  • RL4LMs@allenai

    一個用於根據人類偏好微調語言模型的模組化 RL 函式庫

    2,395+0近 7 天星數變化
  • gym-anytrading@AminHP

    最簡單、靈活且完整的 OpenAI Gym 交易環境(經 OpenAI Gym 批准)

    2,388+0近 7 天星數變化
  • PPO-PyTorch@nikhilbarhate99

    在 PyTorch 中最小化實作截斷目標的近端策略最佳化(PPO)

    2,383+0近 7 天星數變化
  • ProtoMotions@NVlabs

    ProtoMotions 是一個用於訓練物理模擬數位人類與人形機器人的 GPU 加速模擬與學習框架。

    2,377+0近 7 天星數變化
  • ICCV2019 - 利用基於模型的深度強化學習學習繪畫

    2,310+0近 7 天星數變化
  • MimicKit@xbpeng

    用於訓練控制器的輕量級動作模仿方法套件。

    2,306+0近 7 天星數變化
  • verl-agent@langfengQ

    verl-agent 是 veRL 的擴充套件,專為透過強化學習 (RL) 訓練 LLM/VLM Agent 所設計。verl-agent 也是論文 "Group-in-Group Policy Optimization for LLM Agent Training" 的官方程式碼。

    2,298+0近 7 天星數變化
  • drl-zh@alessiodm

    深度強化學習:從零到專家!

    2,296+0近 7 天星數變化
  • RecSysPapers@tangxyw

    推薦、廣告與搜尋領域的工業界經典與最新前沿論文集合。

    2,192+0近 7 天星數變化
  • gym-pybullet-drones@learnsyslab

    用於四軸飛行器控制的單一與多代理增強式學習的 PyBullet Gymnasium 環境

    2,128+0近 7 天星數變化
  • ASAP@LeCAR-Lab

    [RSS 2025] 「ASAP:對齊模擬與現實世界物理以學習具備靈活性的人形機器人全身技能」

    2,108+0近 7 天星數變化
  • diamond@eloialonso

    DIAMOND (DIffusion As a Model Of eNvironment Dreams) 是一種在擴散世界模型中訓練的強化學習代理程式。NeurIPS 2024 Spotlight。

    2,104+0近 7 天星數變化
  • ViZDoom@Farama-Foundation

    基於 1993 年遊戲 Doom 的強化學習環境 :godmode:

    2,067+0近 7 天星數變化
← 返回主題列表