reinforcement-learning
標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。
- #91
🤖 機器學習暑期學校指南
★ 3,033+0近 7 天星數變化 - #92★ 3,026+0近 7 天星數變化
- #93
深度學習與深度強化學習研究論文及部分程式碼
★ 3,026+0近 7 天星數變化 - #94★ 2,960+0近 7 天星數變化
- #95★ 2,919+0近 7 天星數變化
- #96
用於 Stable Baselines3 強化學習代理的訓練框架,包含超參數優化與預訓練代理。
★ 2,873+0近 7 天星數變化 - #97
用 100 行程式碼實作論文
★ 2,870+0近 7 天星數變化 - #98
MuZero
★ 2,865+0近 7 天星數變化 - #99
簡單且全面的 TensorFlow 教學
★ 2,841+0近 7 天星數變化 - #100★ 2,806+0近 7 天星數變化
- #101★ 2,786+0近 7 天星數變化
- #102★ 2,657+0近 7 天星數變化
- #103
PPO x Family DRL 教程課程(決策智能入門級公開課:8節課幫你盤清算法理論,理順代碼邏輯,玩轉決策AI應用實踐 )
★ 2,616+0近 7 天星數變化 - #104
用於工業級搜尋、推薦和廣告的精選深度學習論文。專注於 Embedding、Matching、Pre-Ranking、Ranking、Post Ranking、Relevance、LLM 和 RL。請引用我們的論文 "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026)。
★ 2,589+0近 7 天星數變化 - #105★ 2,586+0近 7 天星數變化
- #106
強大推理能力 LLM 的教學、調查與指南資源集合
★ 2,533+0近 7 天星數變化 - #107
《Reinforcement Learning: An Introduction》解答
★ 2,433+0近 7 天星數變化 - #108★ 2,395+0近 7 天星數變化
- #109
最簡單、靈活且完整的 OpenAI Gym 交易環境(經 OpenAI Gym 批准)
★ 2,388+0近 7 天星數變化 - #110
在 PyTorch 中最小化實作截斷目標的近端策略最佳化(PPO)
★ 2,383+0近 7 天星數變化 - #111
ProtoMotions 是一個用於訓練物理模擬數位人類與人形機器人的 GPU 加速模擬與學習框架。
★ 2,377+0近 7 天星數變化 - #112
ICCV2019 - 利用基於模型的深度強化學習學習繪畫
★ 2,310+0近 7 天星數變化 - #113★ 2,306+0近 7 天星數變化
- #114
verl-agent 是 veRL 的擴充套件,專為透過強化學習 (RL) 訓練 LLM/VLM Agent 所設計。verl-agent 也是論文 "Group-in-Group Policy Optimization for LLM Agent Training" 的官方程式碼。
★ 2,298+0近 7 天星數變化 - #115★ 2,296+0近 7 天星數變化
- #116
推薦、廣告與搜尋領域的工業界經典與最新前沿論文集合。
★ 2,192+0近 7 天星數變化 - #117
用於四軸飛行器控制的單一與多代理增強式學習的 PyBullet Gymnasium 環境
★ 2,128+0近 7 天星數變化 - #118★ 2,108+0近 7 天星數變化
- #119
DIAMOND (DIffusion As a Model Of eNvironment Dreams) 是一種在擴散世界模型中訓練的強化學習代理程式。NeurIPS 2024 Spotlight。
★ 2,104+0近 7 天星數變化 - #120★ 2,067+0近 7 天星數變化