grpo
Dépôts open source suivis étiquetés grpo, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de grpo sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés grpo.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Utilisez PEFT ou le paramétrage complet pour CPT/SFT/DPO/GRPO sur plus de 600 LLM et 300 MLLM (AAAI 2025).
★ 15 488+88Évolution des étoiles sur les 7 derniers jours - #2
Bibliothèque open source complète de compétences en recherche et ingénierie IA pour tout modèle d'IA. Emballez ces compétences et votre agent Claude/Codex/Gemini deviendra un agent de recherche IA pleinement opérationnel. Maintenu par Orchestra Research.
★ 12 256+104Évolution des étoiles sur les 7 derniers jours - #3
Agent Reinforcement Trainer : entraînez des agents multi-étapes pour des tâches réelles via GRPO. Offrez une formation en cours d'emploi à vos agents. Apprentissage par renforcement pour Qwen3.6, GPT-OSS, Llama et plus encore.
★ 10 689+10Évolution des étoiles sur les 7 derniers jours - #4
https://adongwanai.github.io/AgentGuide | Guide de développement d'agents IA | Pratique LangGraph | RAG avancé | Reconversion vers les grands modèles | Entretiens sur les grands modèles | Ingénieur algorithme | Banque de questions d'entretien | Apprentissage par renforcement | Synthèse de données
★ 9 116+169Évolution des étoiles sur les 7 derniers jours - #5★ 6 018+4Évolution des étoiles sur les 7 derniers jours
- #6
OpenClaw-RL : Entraînez n'importe quel agent simplement par la parole.
★ 5 665+7Évolution des étoiles sur les 7 derniers jours - #7
Implémenter un LLM de raisonnement en PyTorch à partir de zéro, étape par étape.
★ 5 138+49Évolution des étoiles sur les 7 derniers jours - #8
Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.
★ 4 199+54Évolution des étoiles sur les 7 derniers jours - #9
Skywork-R1V est une série de modèles d'IA multimodaux avancés développée par Skywork AI, spécialisée dans le raisonnement vision-langage.
★ 3 168+0Évolution des étoiles sur les 7 derniers jours - #10
verl-agent est une extension de veRL conçue pour l'entraînement d'agents LLM/VLM par apprentissage par renforcement. verl-agent est également le code officiel de l'article "Group-in-Group Policy Optimization for LLM Agent Training".
★ 2 274+17Évolution des étoiles sur les 7 derniers jours - #11
[ECCV 2026] MixGRPO : Libérer l'efficacité du GRPO basé sur les flux avec des ODE-SDE mixtes
★ 1 177+0Évolution des étoiles sur les 7 derniers jours - #12
La stack d'amélioration continue pour les agents. Nos données d'environnement et nos évaluations alimentent l'amélioration et la surveillance des agents.
★ 1 060+2Évolution des étoiles sur les 7 derniers jours - #13★ 959+64Évolution des étoiles sur les 7 derniers jours
- #14
🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.
★ 669-1Évolution des étoiles sur les 7 derniers jours - #15
[NeurIPS 2025] AutoVLA : un modèle Vision-Langage-Action pour la conduite autonome de bout en bout avec raisonnement adaptatif et réglage fin par renforcement
★ 640+6Évolution des étoiles sur les 7 derniers jours - #16
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent : RL open source pour les LLM et les scénarios d'agents
★ 632+9Évolution des étoiles sur les 7 derniers jours - #17
Explorez le « moment Eurêka » multimodal sur le modèle 2B
★ 623+0Évolution des étoiles sur les 7 derniers jours - #18
Une liste de documents sélectionnés sur l'apprentissage par renforcement pour la génération de vidéo
★ 591+1Évolution des étoiles sur les 7 derniers jours - #19
Un moteur d'apprentissage par renforcement asynchrone pour le post-entraînement omnimodal à grande échelle
★ 591+11Évolution des étoiles sur les 7 derniers jours - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Évolution des étoiles sur les 7 derniers jours