reinforcement-learning
標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。
- #31
Vowpal Wabbit 是一套機器學習系統,透過線上學習、雜湊、allreduce、reduction、learning2search、主動與互動式學習等技術推動機器學習前沿
★ 8,708+0近 7 天星數變化 - #32★ 8,309+0近 7 天星數變化
- #33
在 PaLM 架構之上實作 RLHF(帶人類回饋的強化學習)。基本上是 ChatGPT,但使用 PaLM。
★ 7,866+0近 7 天星數變化 - #34
透過這本非傳統教材,成為破解 AI/ML 研究員/工程師,涵蓋數學、計算與機器學習直觀概念。
★ 7,400+0近 7 天星數變化 - #35
多模態機器學習研究主題閱讀清單
★ 6,926+0近 7 天星數變化 - #36
收集 LLM 論文、部落格與專案,聚焦 OpenAI o1 🍓 與推理技術
★ 6,902+0近 7 天星數變化 - #37
野外強化學習課程
★ 6,566+0近 7 天星數變化 - #38
🔬 精選金融市場中的優秀 LLM 與深度學習策略與工具清單。
★ 6,475+0近 7 天星數變化 - #39★ 6,470+0近 7 天星數變化
- #40
精選的自監督方法清單
★ 6,414+0近 7 天星數變化 - #41★ 6,321+0近 7 天星數變化
- #42★ 6,018+0近 7 天星數變化
- #43★ 5,813+0近 7 天星數變化
- #44★ 5,712+0近 7 天星數變化
- #45
OpenSpiel 是一個環境與算法集合,用於一般強化學習研究以及遊戲中的搜尋/規劃
★ 5,452+0近 7 天星數變化 - #46
一個開源四足機器人寵物框架,用於開發類似 Boston Dynamics 的四足機器人,適合 STEM、編碼與機器人教育、IoT 機器人應用、AI 強化機器人服務、研究以及 DIY 機器人套件開發。
★ 5,246+0近 7 天星數變化 - #47★ 5,188+0近 7 天星數變化
- #48
Deep Reinforcement Learning Nanodegree 课程的仓库
★ 5,176+0近 7 天星數變化 - #49★ 5,141+0近 7 天星數變化
- #50
從零開始在 PyTorch 中實現推理 LLM,逐步說明
★ 5,138+0近 7 天星數變化 - #51
此倉庫包含 Hugging Face 深度強化學習課程
★ 5,006+0近 7 天星數變化 - #52
🌟100+ 原創 LLM / RL 原理圖📚,《大模型算法》作者巨献!💥(100+ LLM/RL Algorithm Maps )
★ 4,838+0近 7 天星數變化 - #53★ 4,754+0近 7 天星數變化
- #54★ 4,705+0近 7 天星數變化
- #55
Google DeepMind 的軟體堆疊,用於物理模擬與強化學習環境,採用 MuJoCo
★ 4,681+0近 7 天星數變化 - #56
[ICML 2021] DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning | 斗地主 AI
★ 4,659+0近 7 天星數變化 - #57
基於 AlphaZero 的乾淨實作,適用於任何框架的任何遊戲 + 教學 + Othello/圍棋/井字棋/四子棋 等
★ 4,512+0近 7 天星數變化 - #58
一份經過精選的強化學習與人類反饋資源列表(持續更新)
★ 4,424+0近 7 天星數變化 - #59★ 4,359+0近 7 天星數變化
- #60
🚀 一個開源、實作導向的課程,彌合基礎 RL 概念與 LLM 對齊、RLVR 及進階代理系統之間的差距
★ 4,199+0近 7 天星數變化