跳到主要内容
buildradar
Sign in
主题 · dpo

dpo

标记 dpo 主题、收录中的开源项目,按星标数排序。

项目数
11
总星标数
33,060
平均星标数
3,005
占比
0.00%

常跟 dpo 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 dpo 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • oumi@oumi-ai

    轻松微调、评估与部署 Qwen、Gemma 或任何开放权重的 LLM!

    9,383+3近 7 天星标变化
  • MedicalGPT@shibing624

    MedicalGPT:使用 ChatGPT 训练管线训练您自己的医疗 GPT 模型。实现增量预训练(PT)、有监督微调(SFT)、RLHF、DPO、ORPO、GRPO 等功能。

    5,771+12近 7 天星标变化
  • Soup@MakazhanAlpamys

    通过单个 YAML 微调 LLM。层流训练可在 4 GB 笔记本 GPU 上运行 8B 模型。

    4,929+1,365近 7 天星标变化
  • align-anything@PKU-Alignment

    Align Anything:使用反馈训练全模态模型

    4,671+3近 7 天星标变化
  • hands-on-modern-rl@walkinglabs

    🚀 一个开源、实作导向的课程,弥合基础 RL 概念与 LLM 对齐、RLVR 及进阶代理系统之间的差距

    4,199+54近 7 天星标变化
  • HALOs@ContextualAI

    一个具有 DPO、KTO、PPO、ORPO 及其他人类意识损失函数(HALO)可扩展实现的库。

    909-1近 7 天星标变化
  • DeepMesh@zhaorw02

    [ICCV 2025] DeepMesh 官方代码:结合强化学习的自回归艺术家网格创建

    736+1近 7 天星标变化
  • oat@sail-sg

    🌾 OAT:一个对研究友好的 LLM 在线对齐框架,包含强化学习、偏好学习等。

    669-1近 7 天星标变化
  • LLamaTuner@jianzhnie

    简单且高效的 LLM 微调工具(支持 LLaMA、LLaMA2、LLaMA3、Qwen、Baichuan、GLM、Falcon),大模型高效量化训练与部署。

    621+0近 7 天星标变化
  • 关于视频生成强化学习的精选论文列表。

    591+1近 7 天星标变化
  • tensorflow-nlp-tutorial@ukairia777

    使用 TensorFlow 整理从文本预处理到 Topic Models、BERT、GPT、LLM 等最新模型下游任务的深度学习 NLP 存储库。

    581+0近 7 天星标变化
← 返回主题列表