跳到主要內容
buildradar
登入
主題 · reinforcement-learning

reinforcement-learning

標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。

共 305 個專案
  • vowpal_wabbit@VowpalWabbit

    Vowpal Wabbit 是一套機器學習系統,透過線上學習、雜湊、allreduce、reduction、learning2search、主動與互動式學習等技術推動機器學習前沿

    8,708+0近 7 天星數變化
  • pysc2@google-deepmind

    星際爭霸 II 學習環境

    8,309+0近 7 天星數變化
  • PaLM-rlhf-pytorch@lucidrains

    在 PaLM 架構之上實作 RLHF(帶人類回饋的強化學習)。基本上是 ChatGPT,但使用 PaLM。

    7,866+0近 7 天星數變化
  • maths-cs-ai-compendium@HenryNdubuaku

    透過這本非傳統教材,成為破解 AI/ML 研究員/工程師,涵蓋數學、計算與機器學習直觀概念。

    7,400+0近 7 天星數變化
  • 多模態機器學習研究主題閱讀清單

    6,926+0近 7 天星數變化
  • 收集 LLM 論文、部落格與專案,聚焦 OpenAI o1 🍓 與推理技術

    6,902+0近 7 天星數變化
  • Practical_RL@yandexdataschool

    野外強化學習課程

    6,566+0近 7 天星數變化
  • 🔬 精選金融市場中的優秀 LLM 與深度學習策略與工具清單。

    6,475+0近 7 天星數變化
  • Mooncake@kvcache-ai

    Mooncake 是 Moonshot AI 提供的領先 LLM 服務 Kimi 的服務平台

    6,470+0近 7 天星數變化
  • 精選的自監督方法清單

    6,414+0近 7 天星數變化
  • PufferLib@PufferAI

    增強學習的擴張

    6,321+0近 7 天星數變化
  • VLM-R1@om-ai-lab

    使用強化式 VLM 解決視覺理解問題。

    6,018+0近 7 天星數變化
  • rllm@rllm-org

    讓大型語言模型的強化學習更普及

    5,813+0近 7 天星數變化
  • AReaL@areal-project

    LLM 基於代理應用的 RL Bridge,簡單且靈活

    5,712+0近 7 天星數變化
  • open_spiel@google-deepmind

    OpenSpiel 是一個環境與算法集合,用於一般強化學習研究以及遊戲中的搜尋/規劃

    5,452+0近 7 天星數變化
  • 一個開源四足機器人寵物框架,用於開發類似 Boston Dynamics 的四足機器人,適合 STEM、編碼與機器人教育、IoT 機器人應用、AI 強化機器人服務、研究以及 DIY 機器人套件開發。

    5,246+0近 7 天星數變化
  • xtuner@InternLM

    為超大型 MoE 模型打造的下一代訓練引擎

    5,188+0近 7 天星數變化
  • deep-reinforcement-learning@udacity

    Deep Reinforcement Learning Nanodegree 课程的仓库

    5,176+0近 7 天星數變化
  • EasyR1@hiyouga

    EasyR1:一個基於 veRL 的高效、可擴展、多模態 RL 訓練框架。

    5,141+0近 7 天星數變化
  • reasoning-from-scratch@rasbt

    從零開始在 PyTorch 中實現推理 LLM,逐步說明

    5,138+0近 7 天星數變化
  • deep-rl-class@huggingface

    此倉庫包含 Hugging Face 深度強化學習課程

    5,006+0近 7 天星數變化
  • LLM-RL-Visualized@changyeyu

    🌟100+ 原創 LLM / RL 原理圖📚,《大模型算法》作者巨献!💥(100+ LLM/RL Algorithm Maps )

    4,838+0近 7 天星數變化
  • trlx@CarperAI

    一個使用 RLHF 的分散式語言模型訓練倉庫

    4,754+0近 7 天星數變化
  • RLinf@RLinf

    RLinf:面向具身與代理 AI 的強化學習基礎設施

    4,705+0近 7 天星數變化
  • dm_control@google-deepmind

    Google DeepMind 的軟體堆疊,用於物理模擬與強化學習環境,採用 MuJoCo

    4,681+0近 7 天星數變化
  • DouZero@kwai

    [ICML 2021] DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning | 斗地主 AI

    4,659+0近 7 天星數變化
  • alpha-zero-general@suragnair

    基於 AlphaZero 的乾淨實作,適用於任何框架的任何遊戲 + 教學 + Othello/圍棋/井字棋/四子棋 等

    4,512+0近 7 天星數變化
  • awesome-RLHF@opendilab

    一份經過精選的強化學習與人類反饋資源列表(持續更新)

    4,424+0近 7 天星數變化
  • ElegantRL@AI4Finance-Foundation

    大規模平行深度強化學習。🔥

    4,359+0近 7 天星數變化
  • hands-on-modern-rl@walkinglabs

    🚀 一個開源、實作導向的課程,彌合基礎 RL 概念與 LLM 對齊、RLVR 及進階代理系統之間的差距

    4,199+0近 7 天星數變化
← 返回主題列表