reinforcement-learning
標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。
- #241★ 766+1近 7 天星數變化
- #242
關於建構自主代理的最新論文集合。包含兩個主題:基於 RL 的代理與基於 LLM 的代理。
★ 760+2近 7 天星數變化 - #243★ 737+1近 7 天星數變化
- #244
Stable-Baselines3 的貢獻套件 - 實驗性強化學習(RL)程式碼
★ 736+1近 7 天星數變化 - #245★ 730+1近 7 天星數變化
- #246
這是一個關於無人機深度強化學習自主避障演算法的專案。
★ 730+0近 7 天星數變化 - #247★ 729+2近 7 天星數變化
- #248★ 727-1近 7 天星數變化
- #249
用於在 Python 中進行撲克 AI 開發的撲克引擎
★ 723+2近 7 天星數變化 - #250
精選的探索式強化學習 (RL) 資源清單(持續更新)
★ 723+0近 7 天星數變化 - #251
論文「Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach」程式碼。
★ 722+1近 7 天星數變化 - #252
基於 keras-rl 與強化學習的德州撲克 OpenAI Gym 環境。包含勝率計算的虛擬渲染與蒙地卡羅方法。
★ 722+0近 7 天星數變化 - #253
[COLM’25] DeepRetrieval — 🔥 透過具備檢索結果的 RLVR 訓練 Search Agent
★ 719+2近 7 天星數變化 - #254
精選的蒙地卡羅樹搜尋論文及其實作列表。
★ 715+0近 7 天星數變化 - #255
基於真實全景圖像進行強化學習的 AI 研究平台。
★ 713-1近 7 天星數變化 - #256
基於模型預測控制的強化學習
★ 710+1近 7 天星數變化 - #257
視覺語言模型論文與模型的頂級前端收集與調查 GitHub 儲存庫。持續更新中。
★ 710+4近 7 天星數變化 - #258★ 709+0近 7 天星數變化
- #259
用於在 Flow-Matching 模型中輕鬆進行強化學習的統一框架
★ 695+6近 7 天星數變化 - #260★ 695+3近 7 天星數變化
- #261
在 Python/Tensorflow 中實作逆向強化學習 (IRL) 演算法。包含 Deep MaxEnt、MaxEnt、LPIRL
★ 681+0近 7 天星數變化 - #262
使用 C++ 並結合部分強固學習(Reinforcement Learning)的爐石戰記模擬器
★ 680+0近 7 天星數變化 - #263
用於 MDP 與 POMDP 的 C++ 框架,並提供 Python 綁定
★ 671+0近 7 天星數變化 - #264
BenchMARL 是一個用於多智能體強化學習 (MARL) 基準測試的函式庫。BenchMARL 能夠快速比較不同的 MARL 演算法、任務與模型,同時堅守其兩大核心原則:可重現性與標準化。
★ 659+5近 7 天星數變化 - #265
用於建構深度強化學習代理人的 PyTorch 圖書館
★ 657+0近 7 天星數變化 - #266
資料科學專案的完整生命週期
★ 653+0近 7 天星數變化 - #267
適用於 Julia 的強化學習套件。
★ 652-1近 7 天星數變化 - #268
長思考鏈推理的最新進展
★ 647-1近 7 天星數變化 - #269★ 645+2近 7 天星數變化
- #270
「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」專案頁面
★ 640+1近 7 天星數變化