reinforcement-learning
reinforcement-learning がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #271
「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」のプロジェクトページ
★ 639+0直近 7 日のスター増減 - #272
機械学習分野でよく使われるアルゴリズムをカプセル化しコードを集めたリポジトリです。大部分はNumpy、Pandas、またはTorchをベースにしています。関連するモデルやアルゴリズムの理解を深めたり、修正して自分用のカスタムコードを作成するのに参考にできます。
★ 635+0直近 7 日のスター増減 - #273★ 633+0直近 7 日のスター増減
- #274
RLAnything (ICML 2026) & AutoTool (ICML 2026)、DemyAgent: LLM およびエージェントシナリオ向けのオープンソース RL
★ 632+9直近 7 日のスター増減 - #275
マルチエージェント家庭シミュレーター VirtualHome を実行するための API
★ 632+2直近 7 日のスター増減 - #276★ 631+0直近 7 日のスター増減
- #277
2B Modelにおけるマルチモーダルな「アハ体験」を探求
★ 623+0直近 7 日のスター増減 - #278
walk-these-waysプロジェクトをUnitree Go2にデプロイする
★ 623+3直近 7 日のスター増減 - #279
Nature Machine Intelligenceに掲載!微分可能物理学のトレーニングに基づいた世界初の現実のロボット(クアッドローター)。
★ 614+9直近 7 日のスター増減 - #280
国立台湾大学(NTU)李宏毅教授の「機械学習(Machine Learning)2021年春」講義ノート
★ 602+3直近 7 日のスター増減 - #281
[ICLR 2026] ReCogDrive: エンドツーエンド自動運転のための強化学習による認知フレームワーク
★ 599+4直近 7 日のスター増減 - #282
強化学習に関する関連論文集。トップカンファレンスの古典的論文から最新論文まで網羅。
★ 595+0直近 7 日のスター増減 - #283
AAAI 2024 論文集:主要な人工知能学会で発表された革新的な研究論文の包括的なコレクション。理解を深めるためのコード実装をシームレスに統合。⭐ このリポジトリで人工知能の最先端の進歩を体験してください!
★ 592+1直近 7 日のスター増減 - #284★ 591+11直近 7 日のスター増減
- #285
動画生成における強化学習に関する論文のキュレーションリスト
★ 591+1直近 7 日のスター増減 - #286
[ICML 2026] 「Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning」の公式リソース
★ 591+1直近 7 日のスター増減 - #287★ 586+0直近 7 日のスター増減
- #288
NeurIPS 2023: Safety-Gymnasium: 統合型安全強化学習ベンチマーク
★ 580+1直近 7 日のスター増減 - #289★ 578+3直近 7 日のスター増減
- #290
Hugging Face の transformer 内の任意の生成モデル(bloomz-176B/bloom/gpt/bart/T5/MetaICL)における ChatGPT RLHF(人間フィードバックによる強化学習)の実装
★ 564+0直近 7 日のスター増減 - #291
自動運転 (Carla) における深層強化学習 (PPO) のスクラッチ実装
★ 563-1直近 7 日のスター増減 - #292
Meta Agents Research Environments は、動的かつ現実的なシナリオで AI エージェントを評価するために設計された包括的なプラットフォームです。静的なベンチマークとは異なり、このプラットフォームは、新しい情報が利用可能になるにつれてエージェントが戦略を適応させなければならない進化する環境を導入し、現実世界の課題を反映しています。
★ 551+3直近 7 日のスター増減 - #293
人工知能(AI)リソースの厳選リスト(コース、ツール、アプリ、オープンソースプロジェクト)
★ 548-1直近 7 日のスター増減 - #294
[NeurIPS 2025 Spotlight] LLM 事後学習スイート。ReasonFlux、ReasonFlux-PRM、ReasonFlux-Coder を搭載。
★ 542+0直近 7 日のスター増減 - #295★ 539+2直近 7 日のスター増減
- #296
UMI on Legs: 操作中心の全身コントローラーによるマニピュレーションポリシーのモバイル化
★ 536+3直近 7 日のスター増減 - #297
CalTech、Columbia、Berkeley、MIT、Stanfordによる、一般公開された機械学習エンジニアリングコースの厳選リスト。
★ 535+1直近 7 日のスター増減 - #298
多目的強化学習アルゴリズムの実装
★ 533+1直近 7 日のスター増減 - #299
[CVPR 2025 Highlight] InterMimic: 物理ベースのヒューマン・オブジェクト・インタラクションに向けた汎用全身制御
★ 528+1直近 7 日のスター増減 - #300
MetaTrader 5 取引プラットフォーム用の汎用性、柔軟性に優れ、使いやすいシミュレータおよび OpenAI Gym 互換の取引環境(OpenAI Gym 承認済)。
★ 524+0直近 7 日のスター増減