メインコンテンツへスキップ
buildradar
Sign in
トピック · reinforcement-learning

reinforcement-learning

reinforcement-learning がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

304 件のリポジトリ
  • ReCall@Agent-RL

    ReSearch: 強化学習を用いたLLMの検索推論学習 & ReCall: 強化学習を用いたLLMのツール呼び出し推論学習

    1,432+1直近 7 日のスター増減
  • Julia で書かれた簡潔で美しいアルゴリズム

    1,426+0直近 7 日のスター増減
  • モデルベース強化学習(Model-based RL)に関する優れたリソースの厳選リスト(随時更新)

    1,393+0直近 7 日のスター増減
  • rl_games@Denys88

    RL(強化学習)の実装

    1,385+2直近 7 日のスター増減
  • OpenCat-Old@PetoiCamp

    STEM 教育および AI 強化サービス向けの、プログラム可能で機動性の高いロボット猫。

    1,372+1直近 7 日のスター増減
  • smac@oxwhirl

    SMAC: StarCraftマルチエージェントチャレンジ

    1,367+1直近 7 日のスター増減
  • DRL-robot-navigation@reiniscimurs

    ROS Gazebo シミュレータにおける移動ロボットのナビゲーションのための深層強化学習。Twin Delayed Deep Deterministic Policy Gradient (TD3) ニューラルネットワークを使用し、ロボットが障害物を回避しながらシミュレーション環境内のランダムな目標地点へ移動する方法を学習する。

    1,362+2直近 7 日のスター増減
  • SLM-Lab@kengz

    PyTorchによるモジュール式深層強化学習フレームワーク。書籍「Foundations of Deep Reinforcement Learning」の補助ライブラリ。

    1,362+0直近 7 日のスター増減
  • Popular-RL-Algorithms@quantumiracle

    Soft Actor-Critic (SAC)、Twin Delayed DDPG (TD3)、Actor-Critic (AC/A2C)、Proximal Policy Optimization (PPO)、QT-Opt、PointNet などの PyTorch 実装

    1,359+1直近 7 日のスター増減
  • agent-apprenticeship@ray-r-ren

    AI エージェントがワークフローのループを通じてタスクを完了し、反復実行によって自己改善を行い、メンターエージェントや人間のフィードバックによって評価され、完了した作業を再利用可能な作業経験やデータに変換して将来のエージェントの改善に活かすための活きたエコシステム。

    1,334+0直近 7 日のスター増減
  • Keras による最小限のディープQ学習(DQN & DDQN)の実装

    1,329+1直近 7 日のスター増減
  • Minari@Farama-Foundation

    オフライン強化学習データセットのための標準フォーマット。主要な参照データセットと関連ユーティリティを含む

    1,294+3直近 7 日のスター増減
  • Learning-Deep-Learning@patrick-llgc

    ディープラーニングと機械学習に関する論文読解ノート

    1,270+0直近 7 日のスター増減
  • PPO-for-Beginners@ericyangyu

    シンプルでスタイリッシュな PPO の実装。Medium の連載シリーズに基づいています: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8

    1,269+1直近 7 日のスター増減
  • android_env@google-deepmind

    AndroidデバイスでのRL研究。

    1,240+0直近 7 日のスター増減
  • alphagen@ICT-FinD-Lab

    強化学習を用いた数式型アルファ(予測)株式ファクターの生成。

    1,213+8直近 7 日のスター増減
  • LearningHumanoidWalking@rohanpsingh

    強化学習を用いた人型ロボットの歩行訓練。

    1,210+3直近 7 日のスター増減
  • パーダーボルン大学が主催する強化学習コースの講義ノート、解答付きチュートリアル課題、オンラインビデオ。

    1,192+1直近 7 日のスター増減
  • flow@flow-project

    交通制御における強化学習のための計算フレームワーク

    1,188+0直近 7 日のスター増減
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Mixed ODE-SDEによるFlowベースのGRPO効率の解放

    1,177+0直近 7 日のスター増減
  • Gym@NVIDIA-NeMo

    環境を使用してモデルやエージェントを評価および改善する

    1,155+7直近 7 日のスター増減
  • SimplerEnv@simpler-env

    一般的なセットアップ(Google Robot、WidowX+Bridgeなど)のシミュレーション環境における、現実世界のロボット操作ポリシー(RT-1、RT-1-X、Octoなど)の評価と再現(CoRL 2024)

    1,153+3直近 7 日のスター増減
  • omnisafe@PKU-Alignment

    JMLR: SafeRLの研究を加速させるためのインフラストラクチャフレームワーク「OmniSafe」

    1,150+1直近 7 日のスター増減
  • evotorch@nnaisense

    NNAISENSEで開発された、PyTorch上で直接動作する高度な進化計算ライブラリ

    1,144+1直近 7 日のスター増減
  • SMARTS@huawei-noah

    自動運転向けスケーラブルマルチエージェントRLトレーニングスクール

    1,134+0直近 7 日のスター増減
  • :computer: 機械に学習させる方法を学び、プログラミングの苦労から解放されましょう。究極のリスト

    1,128+0直近 7 日のスター増減
  • ir-sim@hanruihua

    ナビゲーション、制御、学習用に設計された、Python ベースの軽量ロボットシミュレーター

    1,125+6直近 7 日のスター増減
  • ASE@nv-tlabs

    物理シミュレーションキャラクター向け再利用可能コントローラーの訓練用敵対的スキル埋め込み

    1,119+1直近 7 日のスター増減
  • ARPO@RUC-NLPIR

    [ICLR 2026] エージェント型強化ポリシー最適化 (ARPO)

    1,114+3直近 7 日のスター増減
  • SoundMind@xid32

    複雑な推論タスク向けに特別に設計された 6,446 件のテキスト・音声アノテーション済みサンプルからなる Audio Logical Reasoning (ALR) データセットを提案します。このリソースを基に、音声言語モデル (ALMs) に高度なバイモーダル推論能力を付与するために調整された、ルールベースの強化学習 (RL) アルゴリズムである SoundMind を提案します。

    1,113+0直近 7 日のスター増減
← トピック一覧に戻る