メインコンテンツへスキップ
buildradar
Sign in
トピック · grpo

grpo

grpo がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
20
総スター数
81,418
平均スター数
4,071
シェア
0.00%

grpo と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、grpo がタグ付けされたリポジトリ。

直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。

  • ms-swift@modelscope

    PEFTまたはFull-parameterを使用して、600以上のLLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) および300以上のMLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) に適用する (AAAI 2025)。

    15,488+116直近 7 日のスター増減
  • AI-Research-SKILLs@Orchestra-Research

    あらゆるAIモデルに対応した、包括的なAI研究およびエンジニアリングスキルを提供するオープンソースライブラリ。このスキルをパッケージ化することで、あなたのclaude code/codex/geminiエージェントはフルパワーのAI研究エージェントになります。Orchestra Researchによってメンテナンスされています。

    12,256+176直近 7 日のスター増減
  • ART@OpenPipe

    Agent Reinforcement Trainer: GRPOを用いた実世界タスク向けマルチステップエージェントの訓練。エージェントに現場トレーニングを提供。Qwen3.6、GPT-OSS、Llamaなどに対応した強化学習!

    10,689+24直近 7 日のスター増減
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | AI Agent開発ガイド | LangGraph実践 | 高度RAG | キャリアチェンジLLM | LLM面接 | アルゴリズムエンジニア | 面接問題集 | 強化学習|データ合成

    9,116+273直近 7 日のスター増減
  • VLM-R1@om-ai-lab

    強化学習されたVLMによる視覚理解を解決する

    6,018+3直近 7 日のスター増減
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: 話すだけで任意のエージェントを訓練

    5,665+10直近 7 日のスター増減
  • reasoning-from-scratch@rasbt

    PyTorchで推論LLMをゼロから、ステップバイステップで実装。

    5,138+67直近 7 日のスター増減
  • hands-on-modern-rl@walkinglabs

    🚀 基本的なRLの概念からLLMアライメント、RLVR、高度なエージェンティックシステムへのギャップを埋めるオープンソースの実践的カリキュラム

    4,199+69直近 7 日のスター増減
  • Skywork-R1V@SkyworkAI

    Skywork-R1V は Skywork AI が開発した高度なマルチモーダル AI モデルシリーズで、視覚と言語の推論を専門としています。

    3,168+1直近 7 日のスター増減
  • verl-agent@langfengQ

    verl-agentはveRLの拡張であり、RLを介してLLM/VLMエージェントを訓練するために設計されています。また、論文「Group-in-Group Policy Optimization for LLM Agent Training」の公式コードでもあります。

    2,274+18直近 7 日のスター増減
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Mixed ODE-SDEによるFlowベースのGRPO効率の解放

    1,177+0直近 7 日のスター増減
  • judgeval@JudgmentLabs

    エージェントのための継続的改善スタック。環境データと評価機能により、エージェントの改善とモニタリングを駆動します。

    1,060+1直近 7 日のスター増減
  • verl-omni@verl-project

    拡散モデルおよびオムニモデル向けのマルチモーダル RL トレーニングフレームワーク

    955+56直近 7 日のスター増減
  • oat@sail-sg

    🌾 OAT:強化学習や好みの学習などを含む、LLMオンラインアライメント向けの研究しやすいフレームワーク。

    669-1直近 7 日のスター増減
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA:適応的推論と強化学習によるファインチューニングを備えた、エンドツーエンド自動運転のためのVision-Language-Actionモデル

    640+5直近 7 日のスター増減
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026)、DemyAgent: LLM およびエージェントシナリオ向けのオープンソース RL

    632+7直近 7 日のスター増減
  • VisualThinker-R1-Zero@turningpoint-ai

    2B Modelにおけるマルチモーダルな「アハ体験」を探求

    623+0直近 7 日のスター増減
  • 動画生成における強化学習に関する論文のキュレーションリスト

    591+2直近 7 日のスター増減
  • Relax@redai-studio

    大規模オムニモーダル事後学習のための非同期強化学習エンジン

    590+7直近 7 日のスター増減
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501直近 7 日のスター増減
← トピック一覧に戻る