跳到主要內容
buildradar
Sign in
主題 · dpo

dpo

標記 dpo 主題、收錄中的開源專案,依星數排序。

專案數
11
總星數
33,060
平均星數
3,005
佔比
0.00%

常跟 dpo 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 dpo 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • oumi@oumi-ai

    輕鬆微調、評估與部署 Qwen、Gemma 或任何開放權重的 LLM!

    9,383+3近 7 天星數變化
  • MedicalGPT@shibing624

    MedicalGPT:使用 ChatGPT 訓練管線訓練您自己的醫療 GPT 模型。實現增量預訓練(PT)、有監督微調(SFT)、RLHF、DPO、ORPO、GRPO 等功能。

    5,771+12近 7 天星數變化
  • Soup@MakazhanAlpamys

    透過單一 YAML 微調 LLM。層串流訓練可在 4 GB 筆電 GPU 上執行 8B 模型。

    4,929+1,365近 7 天星數變化
  • align-anything@PKU-Alignment

    Align Anything:使用回饋訓練全模態模型

    4,671+3近 7 天星數變化
  • hands-on-modern-rl@walkinglabs

    🚀 一個開源、實作導向的課程,彌合基礎 RL 概念與 LLM 對齊、RLVR 及進階代理系統之間的差距

    4,199+54近 7 天星數變化
  • HALOs@ContextualAI

    一個具有 DPO、KTO、PPO、ORPO 及其他人類意識損失函數(HALO)可擴充實作的程式庫。

    909-1近 7 天星數變化
  • DeepMesh@zhaorw02

    [ICCV 2025] DeepMesh 官方程式碼:結合強化學習的自迴歸藝術家網格創建

    736+1近 7 天星數變化
  • oat@sail-sg

    🌾 OAT:一個對研究友善的 LLM 線上對齊框架,包含強化學習、偏好學習等。

    669-1近 7 天星數變化
  • LLamaTuner@jianzhnie

    簡單且高效的 LLM 微調工具(支援 LLaMA、LLaMA2、LLaMA3、Qwen、Baichuan、GLM、Falcon),大模型高效量化訓練與部署。

    621+0近 7 天星數變化
  • 關於影片生成強化學習的精選論文列表。

    591+1近 7 天星數變化
  • tensorflow-nlp-tutorial@ukairia777

    使用 TensorFlow 整理從文字預處理到 Topic Models、BERT、GPT、LLM 等最新模型下游任務的深度學習 NLP 儲存庫。

    581+0近 7 天星數變化
← 返回主題列表