メインコンテンツへスキップ
buildradar
Sign in
トピック · reinforcement-learning

reinforcement-learning

reinforcement-learning がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

304 件のリポジトリ
  • Seg-Zero@JIA-Lab-research

    「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」のプロジェクトページ

    639+0直近 7 日のスター増減
  • mlimpl@vincen-github

    機械学習分野でよく使われるアルゴリズムをカプセル化しコードを集めたリポジトリです。大部分はNumpy、Pandas、またはTorchをベースにしています。関連するモデルやアルゴリズムの理解を深めたり、修正して自分用のカスタムコードを作成するのに参考にできます。

    635+0直近 7 日のスター増減
  • ma-gym@koulanurag

    OpenAI gym をベースにしたマルチエージェント環境のコレクション

    633+0直近 7 日のスター増減
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026)、DemyAgent: LLM およびエージェントシナリオ向けのオープンソース RL

    632+9直近 7 日のスター増減
  • virtualhome@xavierpuigf

    マルチエージェント家庭シミュレーター VirtualHome を実行するための API

    632+2直近 7 日のスター増減
  • robohive@vikashplus

    ロボット学習のための統合フレームワーク

    631+0直近 7 日のスター増減
  • VisualThinker-R1-Zero@turningpoint-ai

    2B Modelにおけるマルチモーダルな「アハ体験」を探求

    623+0直近 7 日のスター増減
  • walk-these-waysプロジェクトをUnitree Go2にデプロイする

    623+3直近 7 日のスター増減
  • DiffPhysDrone@HenryHuYu

    Nature Machine Intelligenceに掲載!微分可能物理学のトレーニングに基づいた世界初の現実のロボット(クアッドローター)。

    614+9直近 7 日のスター増減
  • ML-2021-notes@chsiang426

    国立台湾大学(NTU)李宏毅教授の「機械学習(Machine Learning)2021年春」講義ノート

    602+3直近 7 日のスター増減
  • recogdrive@xiaomi-research

    [ICLR 2026] ReCogDrive: エンドツーエンド自動運転のための強化学習による認知フレームワーク

    599+4直近 7 日のスター増減
  • 強化学習に関する関連論文集。トップカンファレンスの古典的論文から最新論文まで網羅。

    595+0直近 7 日のスター増減
  • AAAI-2024-Papers@DmitryRyumin

    AAAI 2024 論文集:主要な人工知能学会で発表された革新的な研究論文の包括的なコレクション。理解を深めるためのコード実装をシームレスに統合。⭐ このリポジトリで人工知能の最先端の進歩を体験してください!

    592+1直近 7 日のスター増減
  • Relax@redai-studio

    大規模オムニモーダル事後学習のための非同期強化学習エンジン

    591+11直近 7 日のスター増減
  • 動画生成における強化学習に関する論文のキュレーションリスト

    591+1直近 7 日のスター増減
  • Graph-R1@LHRLAB

    [ICML 2026] 「Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning」の公式リソース

    591+1直近 7 日のスター増減
  • crafter@danijar

    エージェント能力の広範なベンチマーク

    586+0直近 7 日のスター増減
  • safety-gymnasium@PKU-Alignment

    NeurIPS 2023: Safety-Gymnasium: 統合型安全強化学習ベンチマーク

    580+1直近 7 日のスター増減
  • OmniDrones@btx0424
    578+3直近 7 日のスター増減
  • TextRL@voidful

    Hugging Face の transformer 内の任意の生成モデル(bloomz-176B/bloom/gpt/bart/T5/MetaICL)における ChatGPT RLHF(人間フィードバックによる強化学習)の実装

    564+0直近 7 日のスター増減
  • 自動運転 (Carla) における深層強化学習 (PPO) のスクラッチ実装

    563-1直近 7 日のスター増減
  • Meta Agents Research Environments は、動的かつ現実的なシナリオで AI エージェントを評価するために設計された包括的なプラットフォームです。静的なベンチマークとは異なり、このプラットフォームは、新しい情報が利用可能になるにつれてエージェントが戦略を適応させなければならない進化する環境を導入し、現実世界の課題を反映しています。

    551+3直近 7 日のスター増減
  • awesome-ai@hades217

    人工知能(AI)リソースの厳選リスト(コース、ツール、アプリ、オープンソースプロジェクト)

    548-1直近 7 日のスター増減
  • ReasonFlux@Gen-Verse

    [NeurIPS 2025 Spotlight] LLM 事後学習スイート。ReasonFlux、ReasonFlux-PRM、ReasonFlux-Coder を搭載。

    542+0直近 7 日のスター増減
  • flybody@TuragaLab

    MuJoCoのショウジョウバエ身体モデルと移動強化学習タスク

    539+2直近 7 日のスター増減
  • umi-on-legs@real-stanford

    UMI on Legs: 操作中心の全身コントローラーによるマニピュレーションポリシーのモバイル化

    536+3直近 7 日のスター増減
  • CalTech、Columbia、Berkeley、MIT、Stanfordによる、一般公開された機械学習エンジニアリングコースの厳選リスト。

    535+1直近 7 日のスター増減
  • morl-baselines@LucasAlegre

    多目的強化学習アルゴリズムの実装

    533+1直近 7 日のスター増減
  • InterMimic@Sirui-Xu

    [CVPR 2025 Highlight] InterMimic: 物理ベースのヒューマン・オブジェクト・インタラクションに向けた汎用全身制御

    528+1直近 7 日のスター増減
  • gym-mtsim@AminHP

    MetaTrader 5 取引プラットフォーム用の汎用性、柔軟性に優れ、使いやすいシミュレータおよび OpenAI Gym 互換の取引環境(OpenAI Gym 承認済)。

    524+0直近 7 日のスター増減
← トピック一覧に戻る