Aller au contenu principal
buildradar
Sign in
Sujet · grpo

grpo

Dépôts open source suivis étiquetés grpo, triés par étoiles.

Dépôts
20
Total d'étoiles
81 418
Étoiles en moyenne
4 071
Part
0,00%

Sujets qui apparaissent souvent aux côtés de grpo sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés grpo.

Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.

  • ms-swift@modelscope

    Utilisez PEFT ou le paramétrage complet pour CPT/SFT/DPO/GRPO sur plus de 600 LLM et 300 MLLM (AAAI 2025).

    15 488+88Évolution des étoiles sur les 7 derniers jours
  • AI-Research-SKILLs@Orchestra-Research

    Bibliothèque open source complète de compétences en recherche et ingénierie IA pour tout modèle d'IA. Emballez ces compétences et votre agent Claude/Codex/Gemini deviendra un agent de recherche IA pleinement opérationnel. Maintenu par Orchestra Research.

    12 256+104Évolution des étoiles sur les 7 derniers jours
  • ART@OpenPipe

    Agent Reinforcement Trainer : entraînez des agents multi-étapes pour des tâches réelles via GRPO. Offrez une formation en cours d'emploi à vos agents. Apprentissage par renforcement pour Qwen3.6, GPT-OSS, Llama et plus encore.

    10 689+10Évolution des étoiles sur les 7 derniers jours
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | Guide de développement d'agents IA | Pratique LangGraph | RAG avancé | Reconversion vers les grands modèles | Entretiens sur les grands modèles | Ingénieur algorithme | Banque de questions d'entretien | Apprentissage par renforcement | Synthèse de données

    9 116+169Évolution des étoiles sur les 7 derniers jours
  • VLM-R1@om-ai-lab

    Résoudre la compréhension visuelle avec des VLM renforcés

    6 018+4Évolution des étoiles sur les 7 derniers jours
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL : Entraînez n'importe quel agent simplement par la parole.

    5 665+7Évolution des étoiles sur les 7 derniers jours
  • reasoning-from-scratch@rasbt

    Implémenter un LLM de raisonnement en PyTorch à partir de zéro, étape par étape.

    5 138+49Évolution des étoiles sur les 7 derniers jours
  • hands-on-modern-rl@walkinglabs

    Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.

    4 199+54Évolution des étoiles sur les 7 derniers jours
  • Skywork-R1V@SkyworkAI

    Skywork-R1V est une série de modèles d'IA multimodaux avancés développée par Skywork AI, spécialisée dans le raisonnement vision-langage.

    3 168+0Évolution des étoiles sur les 7 derniers jours
  • verl-agent@langfengQ

    verl-agent est une extension de veRL conçue pour l'entraînement d'agents LLM/VLM par apprentissage par renforcement. verl-agent est également le code officiel de l'article "Group-in-Group Policy Optimization for LLM Agent Training".

    2 274+17Évolution des étoiles sur les 7 derniers jours
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO : Libérer l'efficacité du GRPO basé sur les flux avec des ODE-SDE mixtes

    1 177+0Évolution des étoiles sur les 7 derniers jours
  • judgeval@JudgmentLabs

    La stack d'amélioration continue pour les agents. Nos données d'environnement et nos évaluations alimentent l'amélioration et la surveillance des agents.

    1 060+2Évolution des étoiles sur les 7 derniers jours
  • verl-omni@verl-project

    Framework d'entraînement RL multimodal pour modèles de diffusion et omni

    959+64Évolution des étoiles sur les 7 derniers jours
  • oat@sail-sg

    🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.

    669-1Évolution des étoiles sur les 7 derniers jours
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA : un modèle Vision-Langage-Action pour la conduite autonome de bout en bout avec raisonnement adaptatif et réglage fin par renforcement

    640+6Évolution des étoiles sur les 7 derniers jours
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent : RL open source pour les LLM et les scénarios d'agents

    632+9Évolution des étoiles sur les 7 derniers jours
  • VisualThinker-R1-Zero@turningpoint-ai

    Explorez le « moment Eurêka » multimodal sur le modèle 2B

    623+0Évolution des étoiles sur les 7 derniers jours
  • Une liste de documents sélectionnés sur l'apprentissage par renforcement pour la génération de vidéo

    591+1Évolution des étoiles sur les 7 derniers jours
  • Relax@redai-studio

    Un moteur d'apprentissage par renforcement asynchrone pour le post-entraînement omnimodal à grande échelle

    591+11Évolution des étoiles sur les 7 derniers jours
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets