メインコンテンツへスキップ
buildradar
Sign in
トピック · rl

rl

rl がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
45
総スター数
111,909
平均スター数
2,487
シェア
0.01%

rl と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、rl がタグ付けされたリポジトリ。

直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。

  • Llama-Chinese@LlamaChinese

    Llama中国コミュニティ。最新のLlama学習資料をリアルタイムで集約し、完全オープンソースで商用利用可能な最高の中国語Llama大規模モデルエコシステムを構築。

    14,740+1直近 7 日のスター増減
  • tianshou@thu-ml

    エレガントなPyTorchディープ強化学習ライブラリ。

    10,945+11直近 7 日のスター増減
  • dopamine@google

    Dopamineは、強化学習アルゴリズムの高速プロトタイピングのための研究フレームワークです。

    10,901+4直近 7 日のスター増減
  • ART@OpenPipe

    Agent Reinforcement Trainer: GRPOを用いた実世界タスク向けマルチステップエージェントの訓練。エージェントに現場トレーニングを提供。Qwen3.6、GPT-OSS、Llamaなどに対応した強化学習!

    10,679+57直近 7 日のスター増減
  • AReaL@areal-project

    LLMベースのエージェントアプリケーションのためのRL Bridge。シンプルかつ柔軟に設計されています。

    5,703+19直近 7 日のスター増減
  • EasyR1@hiyouga

    EasyR1: veRLに基づいた、効率的でスケーラブルなマルチモーダルRLトレーニングフレームワーク

    5,136+10直近 7 日のスター増減
  • hands-on-modern-rl@walkinglabs

    🚀 基本的なRLの概念からLLMアライメント、RLVR、高度なエージェンティックシステムへのギャップを埋めるオープンソースの実践的カリキュラム

    4,145+94直近 7 日のスター増減
  • agent-sandbox@kubernetes-sigs

    agent-sandbox は、分離されたステートフルなシングルトンワークロードの簡単な管理を可能にし、AI エージェントランタイムや強化学習(RL)などのユースケースに最適です。

    3,678+92直近 7 日のスター増減
  • AlphaZero_Gomoku@junxiaosong

    五目並べのためのAlphaZeroアルゴリズムの実装

    3,625+2直近 7 日のスター増減
  • rl@pytorch

    強化学習のための、モジュール式でプリミティブ中心の Python ファーストな PyTorch ライブラリ

    3,540+12直近 7 日のスター増減
  • Stable Baselines3 強化学習エージェントのためのトレーニングフレームワーク。ハイパーパラメータ最適化と事前トレーニング済みエージェントが含まれています。

    2,872+3直近 7 日のスター増減
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    100行のコードによる論文の実装

    2,867+8直近 7 日のスター増減
  • muzero-general@werner-duvaud

    MuZero

    2,863+4直近 7 日のスター増減
  • Awesome-RL-for-LRMs@TsinghuaC3I

    大規模推論モデルのための強化学習サーベイ

    2,481+2直近 7 日のスター増減
  • all-rl-algorithms@FareedKhan-dev

    強化学習アルゴリズムをよりシンプルに実装

    1,922+7直近 7 日のスター増減
  • PRIME@PRIME-RL

    言語モデルの高度な推論のためのスケーラブルな RL ソリューション

    1,872+3直近 7 日のスター増減
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL: 強化学習による VLA トレーニングのスケーリング

    1,839+9直近 7 日のスター増減
  • System-2 推論に関する最新の進展

    1,353+1直近 7 日のスター増減
  • understand-r1-zero@sail-sg

    R1-Zero-Likeトレーニングの理解:批判的視点

    1,274+1直近 7 日のスター増減
  • diy-llm@datawhalechina

    🎓 LLM(大規模言語モデル)構築の体系的カリキュラム|🛠️ 事前学習データエンジニアリング、Tokenizer、Transformer、MoE、GPUプログラミング(CUDA/Triton)、分散学習、スケーリング則、推論最適化、アライメント(SFT/RLHF/GRPO)を網羅|🚀 6つの段階的な課題とコード駆動により、LLMのフルスタックな認知体系を構築

    1,260+22直近 7 日のスター増減
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: テスト時強化学習

    1,121+5直近 7 日のスター増減
  • ARPO@RUC-NLPIR

    [ICLR 2026] エージェント型強化ポリシー最適化 (ARPO)

    1,111+3直近 7 日のスター増減
  • SDPO@lasgroup

    自己蒸留による強化学習 (SDPO)

    1,080+8直近 7 日のスター増減
  • judgeval@JudgmentLabs

    エージェントのための継続的改善スタック。環境データと評価機能により、エージェントの改善とモニタリングを駆動します。

    1,058+1直近 7 日のスター増減
  • tensorlake@tensorlakeai

    Tensorlakeは、サンドボックスおよびバックグラウンドエージェントアプリケーションのデプロイメントのためのサーバーレスランタイムです

    995+1直近 7 日のスター増減
  • OpenDerisk@derisk-ai

    AIネイティブなリスクインテリジェンスシステム「OpenDeRisk」——アプリケーションシステムの24時間365日の包括的かつ詳細な保護を提供するリスクインテリジェントマネージャー

    968+3直近 7 日のスター増減
  • mushroom-rl@MushroomRL

    強化学習用の Python ライブラリ

    944+1直近 7 日のスター増減
  • AI-Compass@tingaicompass

    「AI-Compass」は、AI 技術の海原を航海するための指針をコミュニティに提供します。初心者から上級開発者まで、AI のあらゆる分野への道を見つけることができます。開発者が AI のコアコンセプト、主要技術、最新トレンドを体系的に理解し、実践を通じて理論から実装までの全プロセスを習得することを目的としています。

    926+12直近 7 日のスター増減
  • zeroth-bot@zeroth-robotics

    sim-to-realおよび強化学習(RL)向けの3Dプリント製オープンソースヒューマノイドロボットプラットフォーム

    820+1直近 7 日のスター増減
  • mobilegym@Purewhiter

    MobileGym: モバイル GUI エージェント研究のための検証可能かつ高度に並列化されたシミュレーションプラットフォーム · ブラウザで動作する Android シミュレータ · Browser-hosted Android Simulator · 検証可能な評価 · スケーラブルなオンライン RL トレーニング

    777+10直近 7 日のスター増減
← トピック一覧に戻る