Aller au contenu principal
buildradar
Sign in
Sujet · rl

rl

Dépôts open source suivis étiquetés rl, triés par étoiles.

Dépôts
45
Total d'étoiles
111 909
Étoiles en moyenne
2 487
Part
0,01%

Sujets qui apparaissent souvent aux côtés de rl sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés rl.

Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.

  • Llama-Chinese@LlamaChinese

    Communauté chinoise Llama, regroupant en temps réel les dernières ressources d'apprentissage Llama, construisant le meilleur écosystème open source pour le grand modèle Llama en chinois, entièrement open source et commercialisable.

    14 740+1Évolution des étoiles sur les 7 derniers jours
  • tianshou@thu-ml

    Une bibliothèque élégante d'apprentissage par renforcement profond pour PyTorch.

    10 945+11Évolution des étoiles sur les 7 derniers jours
  • dopamine@google

    Dopamine est un framework de recherche pour le prototypage rapide d'algorithmes d'apprentissage par renforcement.

    10 901+4Évolution des étoiles sur les 7 derniers jours
  • ART@OpenPipe

    Agent Reinforcement Trainer : entraînez des agents multi-étapes pour des tâches réelles via GRPO. Offrez une formation en cours d'emploi à vos agents. Apprentissage par renforcement pour Qwen3.6, GPT-OSS, Llama et plus encore.

    10 679+57Évolution des étoiles sur les 7 derniers jours
  • AReaL@areal-project

    Le pont RL pour les applications d'agents basées sur LLM. Simple et flexible.

    5 703+19Évolution des étoiles sur les 7 derniers jours
  • EasyR1@hiyouga

    EasyR1 : un framework d'entraînement RL multimodal, efficace et évolutif, basé sur veRL.

    5 136+10Évolution des étoiles sur les 7 derniers jours
  • hands-on-modern-rl@walkinglabs

    Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.

    4 145+94Évolution des étoiles sur les 7 derniers jours
  • agent-sandbox@kubernetes-sigs

    agent-sandbox permet une gestion simplifiée de charges de travail isolées, avec état et singleton, idéal pour les runtimes d'agents IA et l'apprentissage par renforcement (RL).

    3 678+92Évolution des étoiles sur les 7 derniers jours
  • AlphaZero_Gomoku@junxiaosong

    Une implémentation de l'algorithme AlphaZero pour le Gomoku (également appelé Gobang ou Puissance 5).

    3 625+2Évolution des étoiles sur les 7 derniers jours
  • rl@pytorch

    Une bibliothèque PyTorch modulaire, axée sur les primitives et Python, pour l'apprentissage par renforcement.

    3 540+12Évolution des étoiles sur les 7 derniers jours
  • Un framework d'entraînement pour les agents d'apprentissage par renforcement Stable Baselines3, incluant l'optimisation des hyperparamètres et des agents pré-entraînés.

    2 872+3Évolution des étoiles sur les 7 derniers jours
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    Implémentation d'articles de recherche en 100 lignes de code.

    2 867+8Évolution des étoiles sur les 7 derniers jours
  • muzero-general@werner-duvaud

    MuZero

    2 863+4Évolution des étoiles sur les 7 derniers jours
  • Awesome-RL-for-LRMs@TsinghuaC3I

    Une étude sur l'apprentissage par renforcement pour les grands modèles de raisonnement

    2 481+2Évolution des étoiles sur les 7 derniers jours
  • all-rl-algorithms@FareedKhan-dev

    Implémentation simplifiée de tous les algorithmes d'apprentissage par renforcement (RL).

    1 922+7Évolution des étoiles sur les 7 derniers jours
  • PRIME@PRIME-RL

    Solution d'apprentissage par renforcement (RL) évolutive pour le raisonnement avancé des modèles de langage

    1 872+3Évolution des étoiles sur les 7 derniers jours
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL : Mise à l'échelle de l'entraînement VLA via l'apprentissage par renforcement.

    1 839+9Évolution des étoiles sur les 7 derniers jours
  • Dernières avancées sur le raisonnement de type System-2.

    1 353+1Évolution des étoiles sur les 7 derniers jours
  • understand-r1-zero@sail-sg

    Comprendre l'entraînement de type R1-Zero : une perspective critique

    1 274+1Évolution des étoiles sur les 7 derniers jours
  • diy-llm@datawhalechina

    Cours systématique sur la construction de grands modèles de langage (LLM) couvrant l'ingénierie des données de pré-entraînement, Tokenizer, Transformer, MoE, programmation GPU (CUDA/Triton), entraînement distribué, lois d'échelle, optimisation de l'inférence et alignement (SFT/RLHF/GRPO), avec 6 exercices progressifs axés sur le code.

    1 260+22Évolution des étoiles sur les 7 derniers jours
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL : Apprentissage par renforcement en temps de test (Test-Time Reinforcement Learning).

    1 121+5Évolution des étoiles sur les 7 derniers jours
  • ARPO@RUC-NLPIR

    [ICLR 2026] Agentic Reinforced Policy Optimization (ARPO).

    1 111+3Évolution des étoiles sur les 7 derniers jours
  • SDPO@lasgroup

    Apprentissage par renforcement via auto-distillation (SDPO)

    1 080+8Évolution des étoiles sur les 7 derniers jours
  • judgeval@JudgmentLabs

    La stack d'amélioration continue pour les agents. Nos données d'environnement et nos évaluations alimentent l'amélioration et la surveillance des agents.

    1 058+1Évolution des étoiles sur les 7 derniers jours
  • tensorlake@tensorlakeai

    Tensorlake est un runtime serverless pour les sandboxes et le déploiement d'applications d'agents en arrière-plan

    995+1Évolution des étoiles sur les 7 derniers jours
  • OpenDerisk@derisk-ai

    Systèmes d'intelligence des risques natifs pour l'IA, OpenDeRisk : votre gestionnaire intelligent des risques applicatifs assure une protection complète et approfondie 24h/24 et 7j/7.

    968+3Évolution des étoiles sur les 7 derniers jours
  • mushroom-rl@MushroomRL

    Bibliothèque Python pour l'apprentissage par renforcement.

    944+1Évolution des étoiles sur les 7 derniers jours
  • AI-Compass@tingaicompass

    AI-Compass guide la communauté à travers l'océan des technologies IA, offrant des parcours pour les débutants comme pour les développeurs avancés. Il vise à aider les développeurs à comprendre systématiquement les concepts fondamentaux, les technologies dominantes et les tendances de l'IA, tout en maîtrisant le passage de la théorie à la pratique.

    926+12Évolution des étoiles sur les 7 derniers jours
  • zeroth-bot@zeroth-robotics

    Plateforme de robot humanoïde open source imprimée en 3D pour le sim-to-real et l'apprentissage par renforcement

    820+1Évolution des étoiles sur les 7 derniers jours
  • mobilegym@Purewhiter

    MobileGym : une plateforme de simulation vérifiable et hautement parallèle pour la recherche sur les agents d'interface graphique mobile, simulateur Android hébergé dans le navigateur, évaluation vérifiable, entraînement RL en ligne évolutif.

    777+10Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets