dpo
Dépôts open source suivis étiquetés dpo, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de dpo sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés dpo.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1★ 9 383+3Évolution des étoiles sur les 7 derniers jours
- #2
MedicalGPT : Entraînez votre propre modèle médical avec le pipeline ChatGPT, incluant le pré-entraînement incrémental (PT), le fine-tuning supervisé (SFT), RLHF, DPO, ORPO et GRPO.
★ 5 771+12Évolution des étoiles sur les 7 derniers jours - #3
Fine-tuning de LLM à partir d'un seul fichier YAML. Le streaming de couches permet d'entraîner un modèle 8B sur un GPU d'ordinateur portable de 4 Go.
★ 4 929+1 365Évolution des étoiles sur les 7 derniers jours - #4
Align Anything : Entraînement de modèles multimodaux avec rétroaction.
★ 4 671+3Évolution des étoiles sur les 7 derniers jours - #5
Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.
★ 4 199+54Évolution des étoiles sur les 7 derniers jours - #6
Une bibliothèque avec des implémentations extensibles de DPO, KTO, PPO, ORPO et d'autres fonctions de perte centrées sur l'humain (HALO).
★ 909-1Évolution des étoiles sur les 7 derniers jours - #7
[ICCV 2025] Code officiel de DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement Learning
★ 736+1Évolution des étoiles sur les 7 derniers jours - #8
🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.
★ 669-1Évolution des étoiles sur les 7 derniers jours - #9
Fine-tuning simple et efficace de LLM (prise en charge de LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Entraînement et déploiement de quantification efficace pour grands modèles.
★ 621+0Évolution des étoiles sur les 7 derniers jours - #10
Une liste de documents sélectionnés sur l'apprentissage par renforcement pour la génération de vidéo
★ 591+1Évolution des étoiles sur les 7 derniers jours - #11
Dépôt NLP de Deep Learning résumant les tâches en aval, du prétraitement du texte aux modèles les plus récents comme Topic Models, BERT, GPT et LLM en utilisant TensorFlow.
★ 581+0Évolution des étoiles sur les 7 derniers jours