メインコンテンツへスキップ
buildradar
Sign in
トピック · dpo

dpo

dpo がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
11
総スター数
33,060
平均スター数
3,005
シェア
0.00%

dpo と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、dpo がタグ付けされたリポジトリ。

直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。

  • oumi@oumi-ai

    Qwen、Gemma、または任意のオープンウェイトLLMを簡単にファインチューニング、評価、デプロイ可能!

    9,383+3直近 7 日のスター増減
  • MedicalGPT@shibing624

    MedicalGPT: ChatGPTトレーニングパイプラインを使用した独自のMedical GPTモデルのトレーニング。医療大規模モデルのトレーニングを行い、インクリメンタル事前学習(PT)、教師ありファインチューニング(SFT)、RLHF、DPO、ORPO、GRPOを実装しています。

    5,771+12直近 7 日のスター増減
  • Soup@MakazhanAlpamys

    1つのYAMLファイルからLLMをファインチューニング。レイヤーストリーミングにより、4 GBのラップトップGPUで8Bモデルを学習可能。

    4,929+1,365直近 7 日のスター増減
  • align-anything@PKU-Alignment

    Align Anything: フィードバックを用いた全モダリティモデルのトレーニング。

    4,671+3直近 7 日のスター増減
  • hands-on-modern-rl@walkinglabs

    🚀 基本的なRLの概念からLLMアライメント、RLVR、高度なエージェンティックシステムへのギャップを埋めるオープンソースの実践的カリキュラム

    4,199+54直近 7 日のスター増減
  • HALOs@ContextualAI

    DPO、KTO、PPO、ORPO、およびその他のヒューマンアウェア損失関数(HALO)の拡張可能な実装を提供するライブラリ

    909-1直近 7 日のスター増減
  • DeepMesh@zhaorw02

    [ICCV 2025] DeepMesh の公式コード: 強化学習を用いた自己回帰型アーティストメッシュの生成

    736+1直近 7 日のスター増減
  • oat@sail-sg

    🌾 OAT:強化学習や好みの学習などを含む、LLMオンラインアライメント向けの研究しやすいフレームワーク。

    669-1直近 7 日のスター増減
  • LLamaTuner@jianzhnie

    LLM の簡単かつ効率的なファインチューニング。(Llama、Llama2、Llama3、Qwen、Baichuan、GLM、Falcon をサポート)大模型高效量化训练+部署。

    621+0直近 7 日のスター増減
  • 動画生成における強化学習に関する論文のキュレーションリスト

    591+1直近 7 日のスター増減
  • tensorflow-nlp-tutorial@ukairia777

    TensorFlowを使用してテキスト前処理から、トピックモデル、BERT、GPT、LLMなどの最新モデルのダウンストリームタスクまでをまとめたDeep Learning NLPリポジトリ

    581+0直近 7 日のスター増減
← トピック一覧に戻る