メインコンテンツへスキップ
buildradar
Sign in
トピック · rlhf

rlhf

rlhf がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

44 件のリポジトリ
  • HALOs@ContextualAI

    DPO、KTO、PPO、ORPO、およびその他のヒューマンアウェア損失関数(HALO)の拡張可能な実装を提供するライブラリ

    909-1直近 7 日のスター増減
  • OpenJudge@agentscope-ai

    OpenJudge: 総合評価と品質報酬のための統一フレームワーク

    819+12直近 7 日のスター増減
  • 大規模言語モデルのオンポリシー蒸留(OPD)に関する論文、テクニカルレポート、フレームワーク、ツールの厳選コレクション。

    791+26直近 7 日のスター増減
  • reward-bench@allenai

    RewardBench: 報酬モデルのための初の評価ツール

    735+2直近 7 日のスター増減
  • Trinity-RFT@agentscope-ai

    Trinity-RFT は、大規模言語モデル(LLM)の強化学習微調整(RFT)向けに設計された、汎用的で柔軟かつスケーラブルなフレームワークです。

    698+2直近 7 日のスター増減
  • oat@sail-sg

    🌾 OAT:強化学習や好みの学習などを含む、LLMオンラインアライメント向けの研究しやすいフレームワーク。

    669-1直近 7 日のスター増減
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026)、DemyAgent: LLM およびエージェントシナリオ向けのオープンソース RL

    632+9直近 7 日のスター増減
  • LLamaTuner@jianzhnie

    LLM の簡単かつ効率的なファインチューニング。(Llama、Llama2、Llama3、Qwen、Baichuan、GLM、Falcon をサポート)大模型高效量化训练+部署。

    621+0直近 7 日のスター増減
  • Relax@redai-studio

    大規模オムニモーダル事後学習のための非同期強化学習エンジン

    591+10直近 7 日のスター増減
  • SPPO@uclaml

    Self-Play Preference Optimization (SPPO) の公式実装

    589+0直近 7 日のスター増減
  • TextRL@voidful

    Hugging Face の transformer 内の任意の生成モデル(bloomz-176B/bloom/gpt/bart/T5/MetaICL)における ChatGPT RLHF(人間フィードバックによる強化学習)の実装

    564+0直近 7 日のスター増減
  • Online-RLHF@RLHFlow

    オンラインRLHFおよびオンライン反復DPOのためのレシピ。

    544+0直近 7 日のスター増減
  • 大規模言語モデルのオンポリシー蒸留に関する論文とリソースの厳選されたコレクション

    534+9直近 7 日のスター増減
  • dLLM-RL@Gen-Verse

    [ICLR 2026] TraceRLの公式コード:Diffusion LLMのポストトレーニングを革新し、SOTAのTraDoシリーズを駆動する

    520+1直近 7 日のスター増減
← トピック一覧に戻る