メインコンテンツへスキップ
buildradar
Sign in
トピック · rlhf

rlhf

rlhf がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
44
総スター数
223,657
平均スター数
5,083
シェア
0.01%

rlhf と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、rlhf がタグ付けされたリポジトリ。

直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。

  • LlamaFactory@hiyouga

    100以上のLLMおよびVLMの統一的効率的なファインチューニング (ACL 2024)

    74,532+89直近 7 日のスター増減
  • Open-Assistant@LAION-AI

    OpenAssistantは、タスクを理解し、サードパーティシステムと連携し、それを行うために情報を動的に取得できるチャットベースのアシスタント

    37,401-7直近 7 日のスター増減
  • LLMSurvey@RUCAIBox

    サーベイ論文「A Survey of Large Language Models」の公式GitHubページ。

    12,208+2直近 7 日のスター増減
  • InternLM@InternLM

    InternLMシリーズ(InternLM, InternLM2, InternLM2.5, InternLM3)の公式リリース。

    7,277+4直近 7 日のスター増減
  • 中国語LLaMA-2 & Alpaca-2大規模モデルフェーズ2プロジェクト + 64K超長コンテキストモデル (Chinese LLaMA-2 & Alpaca-2 LLMs with 64K long context models)

    7,120+0直近 7 日のスター増減
  • alignment-handbook@huggingface

    人間およびAIの好みに言語モデルを合わせるための堅牢なレシピ

    5,670-3直近 7 日のスター増減
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: 話すだけで任意のエージェントを訓練

    5,665+7直近 7 日のスター増減
  • transformerlab-app@transformerlab

    AI研究者がローカルハードウェアからGPUクラスターまで、モデルをシームレスにトレーニング、評価、スケーリングするためのオープンソース研究環境。

    5,185+3直近 7 日のスター増減
  • reasoning-from-scratch@rasbt

    PyTorchで推論LLMをゼロから、ステップバイステップで実装。

    5,138+49直近 7 日のスター増減
  • argilla@argilla-io

    Argillaは、AIエンジニアやドメインエキスパートが高品質なデータセットを構築するためのコラボレーションツールです。

    5,093+5直近 7 日のスター増減
  • Kiln@Kiln-AI

    AIシステムの構築、評価、最適化。evals、RAG、エージェント、ファインチューニング、合成データ生成、データセット管理、MCPなどを含む。

    5,042+5直近 7 日のスター増減
  • align-anything@PKU-Alignment

    Align Anything: フィードバックを用いた全モダリティモデルのトレーニング。

    4,671+3直近 7 日のスター増減
  • awesome-RLHF@opendilab

    人間フィードバックによる強化学習(Reinforcement Learning with Human Feedback)のリソースを厳選したリスト(継続的に更新中)。

    4,424+2直近 7 日のスター増減
  • hands-on-modern-rl@walkinglabs

    🚀 基本的なRLの概念からLLMアライメント、RLVR、高度なエージェンティックシステムへのギャップを埋めるオープンソースの実践的カリキュラム

    4,199+54直近 7 日のスター増減
  • docta@Docta-ai

    データのためのドクター

    3,485-1直近 7 日のスター増減
  • distilabel@argilla-io

    Distilabel は、検証済みの研究論文に基づいた高速、信頼性、拡張性のあるパイプラインを必要とするエンジニア向けの、合成データおよび AI フィードバック用フレームワークです。

    3,384+3直近 7 日のスター増減
  • ROLL@alibaba

    大規模言語モデルを用いた強化学習のための、効率的でユーザーフレンドリーなスケーリングライブラリ

    3,380+6直近 7 日のスター増減
  • TorchLeet@Exorust

    PyTorch 向けの LeetCode — Google、Meta、Anthropic の実際の面接からの 65 の ML/AI 面接問題。Jupyter ノートブック、自動採点機能、MCP AI チューターが含まれています。

    2,461+12直近 7 日のスター増減
  • rlhf-book@natolambert

    人間フィードバックからの強化学習に関する教科書

    2,357+11直近 7 日のスター増減
  • alpaca_eval@tatsu-lab

    指示追従型言語モデルのための自動評価ツール。人間による検証済み、高品質、低コスト、高速。

    2,012-1直近 7 日のスター増減
  • AgentsMeetRL@thinkwee

    Agentic RL に関する Awesome リスト

    1,832+29直近 7 日のスター増減
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward:テキストから画像への生成における人間の好みの学習と評価

    1,703+1直近 7 日のスター増減
  • safe-rlhf@PKU-Alignment

    Safe RLHF: 人間からのフィードバックによる安全な強化学習を通じた制約付き価値アライメント

    1,613+1直近 7 日のスター増減
  • WebGLM@THUDM

    WebGLM: 効率的なWeb拡張型質問応答システム (KDD 2023)

    1,601-1直近 7 日のスター増減
  • RLHF 用の報酬モデルをトレーニングするためのレシピ集

    1,541+0直近 7 日のスター増減
  • MOSS-RLHF@OpenLMLab

    大規模言語モデルにおける RLHF の秘密 パート1: PPO

    1,430+0直近 7 日のスター増減
  • xtreme1@xtreme1-io

    Xtreme1は、マルチモーダルデータ学習向けのオールインワンのデータラベリング・アノテーションプラットフォームであり、3D LiDAR点群、画像、LLMをサポートしています。

    1,239+2直近 7 日のスター増減
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO: 参照フリーの報酬を用いたシンプルな選好最適化

    959+1直近 7 日のスター増減
  • verl-omni@verl-project

    拡散モデルおよびオムニモデル向けのマルチモーダル RL トレーニングフレームワーク

    955+60直近 7 日のスター増減
  • AI-Compass@tingaicompass

    「AI-Compass」は、AI 技術の海原を航海するための指針をコミュニティに提供します。初心者から上級開発者まで、AI のあらゆる分野への道を見つけることができます。開発者が AI のコアコンセプト、主要技術、最新トレンドを体系的に理解し、実践を通じて理論から実装までの全プロセスを習得することを目的としています。

    933+10直近 7 日のスター増減
← トピック一覧に戻る