reinforcement-learning
標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。
相關主題
常跟 reinforcement-learning 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 reinforcement-learning 主題的專案。
- #1
一個充滿活力的生態系統,在此系統中 AI agent 透過工作流程迴圈完成任務、藉由迭代執行來改進、透過導師 agent 或人工介入進行評估,並將已完成的工作轉化為可重複使用的工作經驗與資料,以提升未來的 agent。
★ 1,334 - #2★ 875
- #3
人形机器人运动智能论文、开源项目、产业与求职知识库
★ 509 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160 - #5
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
電腦科學課程與影片講座列表
★ 83,389+163近 7 天星數變化 - #2
本機 UI,用於執行與訓練 LLM 與擴散模型,支援 Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、DeepSeek-V4、FLUX 等多種模型
★ 75,515+337近 7 天星數變化 - #3
🧑🏫 60+ 深度學習論文實作與教學,附並排筆記 📝;包括 transformers(原版、xl、switch、feedback、vit 等)、optimizers(adam、adabelief、sophia 等)、GAN(cyclegan、stylegan2 等)、🎮 強化學習(ppo、dqn)、capsnet、蒸餾等 🧠
★ 67,389+21近 7 天星數變化 - #4
學會它。打造它。交付給他人。
★ 52,098+1,149近 7 天星數變化 - #5
《深入理解 AI Agent:設計原理與工程實踐》(李博杰 著)開源主倉庫:全書正文、編譯版 PDF 與按章配套程式碼
★ 44,381+1,022近 7 天星數變化 - #6★ 43,688+41近 7 天星數變化
- #7★ 33,538+791近 7 天星數變化
- #8
📚 企業分享的資料科學與機器學習實務論文與技術部落格。
★ 30,107+10近 7 天星數變化 - #9★ 29,512+30近 7 天星數變化
- #10★ 21,201+17近 7 天星數變化
- #11
機器學習交易程式碼,第 3 版——從資料取得到即時執行
★ 20,762+43近 7 天星數變化 - #12★ 19,655+2近 7 天星數變化
- #13
點亮 AI 代理的絕佳訓練器。
★ 17,959+56近 7 天星數變化 - #14
這是新書《強化學習的數學基礎》的首頁
★ 17,663+53近 7 天星數變化 - #15
《李宏毅深度學習教程》(李宏毅老師推薦👍,蘋果書🍎),PDF 下載地址:https://github.com/datawhalechina/leedl-tutorial/releases
★ 16,747+8近 7 天星數變化 - #16
精選的人工智慧 (AI) 課程、書籍、影片講座與論文清單。
★ 16,306+44近 7 天星數變化 - #17
Python 實作的強化學習:入門指南
★ 14,758+0近 7 天星數變化 - #18★ 14,711+7近 7 天星數變化
- #19★ 14,600+8近 7 天星數變化
- #20
PyTorch 版 Stable Baselines,可靠的強化學習演算法實作
★ 13,758+21近 7 天星數變化 - #21
透過這些精彩講座,沉浸於深度學習、強化學習、機器學習、電腦視覺與自然語言處理的世界!
★ 12,939+3近 7 天星數變化 - #22★ 12,451+21近 7 天星數變化
- #23★ 11,249+4近 7 天星數變化
- #24
示範如何使用 Amazon SageMaker 建構、訓練與部署機器學習模型的 Jupyter Notebook 範例 📓 🧠
★ 10,983+2近 7 天星數變化 - #25
Agent Reinforcement Trainer:使用 GRPO 訓練多步驟代理以執行真實任務。為您的代理提供在職訓練。支援 Qwen3.6、GPT-OSS、Llama 等的強化學習
★ 10,689+10近 7 天星數變化 - #26★ 10,358+19近 7 天星數變化
- #27
一個易於使用、可擴展且高效能的 Agentic RL 框架,基於 Ray(PPO、DAPO、REINFORCE++、VLM、TIS、vLLM、Ray、Async RL)
★ 9,969+9近 7 天星數變化 - #28
簡單的強化學習教學,莫煩Python 中文AI教學
★ 9,508-2近 7 天星數變化 - #29★ 8,925+37近 7 天星數變化
- #30
機器學習範例與教學合集
★ 8,917+1近 7 天星數變化