Zum Hauptinhalt springen
buildradar
Sign in
Thema · dpo

dpo

Erfasste Open-Source-Repos mit dem Tag dpo, sortiert nach Sternen.

Repos
11
Sterne gesamt
33.060
Sterne im Schnitt
3.005
Anteil
0,00%

Themen, die häufig gemeinsam mit dpo am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit dpo getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • oumi@oumi-ai

    Einfaches Fine-Tuning, Evaluierung und Deployment von Qwen, Gemma oder anderen Open-Weight-LLMs!

    9.383+3Sterne-Änderung der letzten 7 Tage
  • MedicalGPT@shibing624

    MedicalGPT: Trainieren Sie Ihr eigenes medizinisches GPT-Modell mit der ChatGPT-Training-Pipeline. Inklusive prätraining (PT), supervised fine-tuning (SFT), RLHF, DPO, ORPO, GRPO.

    5.771+12Sterne-Änderung der letzten 7 Tage
  • Soup@MakazhanAlpamys

    LLMs aus einer einzigen YAML-Datei fine-tunen. Layer-Streaming trainiert ein 8B-Modell auf einer 4-GB-Laptop-GPU.

    4.929+1.365Sterne-Änderung der letzten 7 Tage
  • align-anything@PKU-Alignment

    Align Anything: Training von Multimodus-Modellen mit Feedback

    4.671+3Sterne-Änderung der letzten 7 Tage
  • hands-on-modern-rl@walkinglabs

    🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.

    4.199+54Sterne-Änderung der letzten 7 Tage
  • HALOs@ContextualAI

    Eine Bibliothek mit erweiterbaren Implementierungen von DPO, KTO, PPO, ORPO und anderen menschzentrierten Verlustfunktionen (HALOs).

    909-1Sterne-Änderung der letzten 7 Tage
  • DeepMesh@zhaorw02

    [ICCV 2025] Offizieller Code von DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement Learning

    736+1Sterne-Änderung der letzten 7 Tage
  • oat@sail-sg

    OAT: Ein forschungsfreundliches Framework für das Online-Alignment von LLMs, einschließlich Reinforcement Learning, Präferenzlernen usw.

    669-1Sterne-Änderung der letzten 7 Tage
  • LLamaTuner@jianzhnie

    Einfaches und effizientes Finetuning von LLMs. (Unterstützt LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon)

    621+0Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste von Forschungsarbeiten zu Reinforcement Learning für die Videogenerierung

    591+1Sterne-Änderung der letzten 7 Tage
  • tensorflow-nlp-tutorial@ukairia777

    Ein Deep-Learning-NLP-Repository mit TensorFlow, das von der Textvorverarbeitung bis hin zu Downstream-Tasks moderner Modelle wie Topic Models, BERT, GPT und LLMs reicht.

    581+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen