dpo
Erfasste Open-Source-Repos mit dem Tag dpo, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit dpo am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit dpo getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Einfaches Fine-Tuning, Evaluierung und Deployment von Qwen, Gemma oder anderen Open-Weight-LLMs!
★ 9.383+3Sterne-Änderung der letzten 7 Tage - #2
MedicalGPT: Trainieren Sie Ihr eigenes medizinisches GPT-Modell mit der ChatGPT-Training-Pipeline. Inklusive prätraining (PT), supervised fine-tuning (SFT), RLHF, DPO, ORPO, GRPO.
★ 5.771+12Sterne-Änderung der letzten 7 Tage - #3
LLMs aus einer einzigen YAML-Datei fine-tunen. Layer-Streaming trainiert ein 8B-Modell auf einer 4-GB-Laptop-GPU.
★ 4.929+1.365Sterne-Änderung der letzten 7 Tage - #4
Align Anything: Training von Multimodus-Modellen mit Feedback
★ 4.671+3Sterne-Änderung der letzten 7 Tage - #5
🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.
★ 4.199+54Sterne-Änderung der letzten 7 Tage - #6
Eine Bibliothek mit erweiterbaren Implementierungen von DPO, KTO, PPO, ORPO und anderen menschzentrierten Verlustfunktionen (HALOs).
★ 909-1Sterne-Änderung der letzten 7 Tage - #7
[ICCV 2025] Offizieller Code von DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement Learning
★ 736+1Sterne-Änderung der letzten 7 Tage - #8
OAT: Ein forschungsfreundliches Framework für das Online-Alignment von LLMs, einschließlich Reinforcement Learning, Präferenzlernen usw.
★ 669-1Sterne-Änderung der letzten 7 Tage - #9
Einfaches und effizientes Finetuning von LLMs. (Unterstützt LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon)
★ 621+0Sterne-Änderung der letzten 7 Tage - #10
Eine kuratierte Liste von Forschungsarbeiten zu Reinforcement Learning für die Videogenerierung
★ 591+1Sterne-Änderung der letzten 7 Tage - #11
Ein Deep-Learning-NLP-Repository mit TensorFlow, das von der Textvorverarbeitung bis hin zu Downstream-Tasks moderner Modelle wie Topic Models, BERT, GPT und LLMs reicht.
★ 581+0Sterne-Änderung der letzten 7 Tage