post-training
Dépôts open source suivis étiquetés post-training, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de post-training sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés post-training.
- #1
Un écosystème vivant où des agents IA accomplissent des tâches via des boucles de workflow, s'améliorent par exécution itérative, sont évalués par des agents mentors ou des humains, et transforment le travail accompli en expérience et données réutilisables pour optimiser les futurs agents.
★ 1 333
- #1
Un framework unifié d'inférence et de post-entraînement pour la génération vidéo accélérée.
★ 4 150+128Évolution des étoiles sur les 7 derniers jours - #2
Tutoriel, enquête et guide sur les LLM de raisonnement.
★ 2 527+4Évolution des étoiles sur les 7 derniers jours - #3
Grand modèle de langage (LLM) pour la santé mentale, incluant pré-entraînement, post-entraînement, jeux de données, évaluation, déploiement et RAG, avec les séries de modèles InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama et GLM.
★ 1 781+3Évolution des étoiles sur les 7 derniers jours - #4
Un écosystème vivant où des agents IA accomplissent des tâches via des boucles de workflow, s'améliorent par exécution itérative, sont évalués par des agents mentors ou des humains, et transforment le travail accompli en expérience et données réutilisables pour optimiser les futurs agents.
★ 1 333-3Évolution des étoiles sur les 7 derniers jours - #5
Collection organisée d'articles, de rapports techniques, de frameworks et d'outils pour la distillation on-policy (OPD) des grands modèles de langage
★ 766+29Évolution des étoiles sur les 7 derniers jours - #6
Code source officiel pour Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights (ICML 2026 Spotlight).
★ 640+0Évolution des étoiles sur les 7 derniers jours - #7
Explorez le « moment Eurêka » multimodal sur le modèle 2B
★ 623+0Évolution des étoiles sur les 7 derniers jours - #8
[ACL 2026 Oral] "LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?"
★ 608+1Évolution des étoiles sur les 7 derniers jours - #9
Un moteur d'apprentissage par renforcement asynchrone pour le post-entraînement omnimodal à grande échelle
★ 582+2Évolution des étoiles sur les 7 derniers jours - #10
[NeurIPS 2025 Spotlight] Suite de post-entraînement pour LLM — incluant ReasonFlux, ReasonFlux-PRM et ReasonFlux-Coder.
★ 542-1Évolution des étoiles sur les 7 derniers jours - #11
Mesurer la capacité des agents CLI tels que Claude Code ou Codex CLI à effectuer le post-entraînement de LLMs de base sur un seul GPU H100 en 10 heures
★ 541+14Évolution des étoiles sur les 7 derniers jours - #12★ 533+2Évolution des étoiles sur les 7 derniers jours