トピック · rlhf
rlhf
rlhf がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
44 件のリポジトリ
- #31★ 909-1直近 7 日のスター増減
- #32★ 819+12直近 7 日のスター増減
- #33
大規模言語モデルのオンポリシー蒸留(OPD)に関する論文、テクニカルレポート、フレームワーク、ツールの厳選コレクション。
★ 791+26直近 7 日のスター増減 - #34
RewardBench: 報酬モデルのための初の評価ツール
★ 735+2直近 7 日のスター増減 - #35
Trinity-RFT は、大規模言語モデル(LLM)の強化学習微調整(RFT)向けに設計された、汎用的で柔軟かつスケーラブルなフレームワークです。
★ 698+2直近 7 日のスター増減 - #36★ 669-1直近 7 日のスター増減
- #37
RLAnything (ICML 2026) & AutoTool (ICML 2026)、DemyAgent: LLM およびエージェントシナリオ向けのオープンソース RL
★ 632+9直近 7 日のスター増減 - #38
LLM の簡単かつ効率的なファインチューニング。(Llama、Llama2、Llama3、Qwen、Baichuan、GLM、Falcon をサポート)大模型高效量化训练+部署。
★ 621+0直近 7 日のスター増減 - #39★ 591+10直近 7 日のスター増減
- #40★ 589+0直近 7 日のスター増減
- #41
Hugging Face の transformer 内の任意の生成モデル(bloomz-176B/bloom/gpt/bart/T5/MetaICL)における ChatGPT RLHF(人間フィードバックによる強化学習)の実装
★ 564+0直近 7 日のスター増減 - #42
オンラインRLHFおよびオンライン反復DPOのためのレシピ。
★ 544+0直近 7 日のスター増減 - #43
大規模言語モデルのオンポリシー蒸留に関する論文とリソースの厳選されたコレクション
★ 534+9直近 7 日のスター増減 - #44★ 520+1直近 7 日のスター増減