Aller au contenu principal
buildradar
Sign in
Sujet · dpo

dpo

Dépôts open source suivis étiquetés dpo, triés par étoiles.

Dépôts
11
Total d'étoiles
33 060
Étoiles en moyenne
3 005
Part
0,00%

Sujets qui apparaissent souvent aux côtés de dpo sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés dpo.

Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.

  • oumi@oumi-ai

    Fine-tunez, évaluez et déployez facilement Qwen, Gemma ou tout LLM à poids ouverts !

    9 383+3Évolution des étoiles sur les 7 derniers jours
  • MedicalGPT@shibing624

    MedicalGPT : Entraînez votre propre modèle médical avec le pipeline ChatGPT, incluant le pré-entraînement incrémental (PT), le fine-tuning supervisé (SFT), RLHF, DPO, ORPO et GRPO.

    5 771+12Évolution des étoiles sur les 7 derniers jours
  • Soup@MakazhanAlpamys

    Fine-tuning de LLM à partir d'un seul fichier YAML. Le streaming de couches permet d'entraîner un modèle 8B sur un GPU d'ordinateur portable de 4 Go.

    4 929+1 365Évolution des étoiles sur les 7 derniers jours
  • align-anything@PKU-Alignment

    Align Anything : Entraînement de modèles multimodaux avec rétroaction.

    4 671+3Évolution des étoiles sur les 7 derniers jours
  • hands-on-modern-rl@walkinglabs

    Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.

    4 199+54Évolution des étoiles sur les 7 derniers jours
  • HALOs@ContextualAI

    Une bibliothèque avec des implémentations extensibles de DPO, KTO, PPO, ORPO et d'autres fonctions de perte centrées sur l'humain (HALO).

    909-1Évolution des étoiles sur les 7 derniers jours
  • DeepMesh@zhaorw02

    [ICCV 2025] Code officiel de DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement Learning

    736+1Évolution des étoiles sur les 7 derniers jours
  • oat@sail-sg

    🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.

    669-1Évolution des étoiles sur les 7 derniers jours
  • LLamaTuner@jianzhnie

    Fine-tuning simple et efficace de LLM (prise en charge de LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Entraînement et déploiement de quantification efficace pour grands modèles.

    621+0Évolution des étoiles sur les 7 derniers jours
  • Une liste de documents sélectionnés sur l'apprentissage par renforcement pour la génération de vidéo

    591+1Évolution des étoiles sur les 7 derniers jours
  • tensorflow-nlp-tutorial@ukairia777

    Dépôt NLP de Deep Learning résumant les tâches en aval, du prétraitement du texte aux modèles les plus récents comme Topic Models, BERT, GPT et LLM en utilisant TensorFlow.

    581+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets