Aller au contenu principal
buildradar
Sign in
Sujet · reasoning

reasoning

Dépôts open source suivis étiquetés reasoning, triés par étoiles.

56 dépôts
  • Search-o1@RUC-NLPIR

    🔍 Search-o1 : Modèles de raisonnement large améliorés par la recherche agentique [EMNLP 2025]

    1 245+2Évolution des étoiles sur les 7 derniers jours
  • DeepAgent@RUC-NLPIR

    [WWW‘26 Oral🔥] DeepAgent : un agent de raisonnement général avec des ensembles d'outils évolutifs.

    1 137+3Évolution des étoiles sur les 7 derniers jours
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL : Apprentissage par renforcement en temps de test (Test-Time Reinforcement Learning).

    1 122+2Évolution des étoiles sur les 7 derniers jours
  • SDPO@lasgroup

    Apprentissage par renforcement via auto-distillation (SDPO)

    1 090+13Évolution des étoiles sur les 7 derniers jours
  • Awesome-MCoT@yaotingwangofficial

    Raisonnement multimodal par chaîne de pensée : une étude complète

    1 025+2Évolution des étoiles sur les 7 derniers jours
  • ThoughtSource@OpenBioLink

    Ressource centrale et ouverte pour les données et outils liés au raisonnement par chaîne de pensée (chain-of-thought) dans les grands modèles de langage. Développé par le groupe de recherche Samwald.

    1 015+0Évolution des étoiles sur les 7 derniers jours
  • [ACL 2023] Raisonnement par prompting de modèles de langage : une étude

    1 007+1Évolution des étoiles sur les 7 derniers jours
  • Code de pré-entraînement et d'inférence pour un modèle de langage récurrent en profondeur à grande échelle.

    942+31Évolution des étoiles sur les 7 derniers jours
  • tutor-gpt@plastic-labs

    Tuteur IA basé sur le raisonnement de la théorie de l'esprit.

    928+4Évolution des étoiles sur les 7 derniers jours
  • [ACL 2026 KnowFM] Ressources impressionnantes sur la recherche approfondie par agents.

    861+6Évolution des étoiles sur les 7 derniers jours
  • self-refine@madaan

    Les LLM peuvent générer des retours sur leur propre travail, les utiliser pour améliorer le résultat et répéter ce processus de manière itérative.

    820+0Évolution des étoiles sur les 7 derniers jours
  • Nucleoid@NucleoidAI

    Langage logique pour LLM 🌱🐋 Construire des modèles du monde 🌍

    769+1Évolution des étoiles sur les 7 derniers jours
  • mathcode@math-ai-org

    MathCode : un agent de codage mathématique de pointe

    741+7Évolution des étoiles sur les 7 derniers jours
  • golitex@litexlang

    Litex : Le langage où les mathématiques se vérifient elles‑mêmes.

    671+9Évolution des étoiles sur les 7 derniers jours
  • oat@sail-sg

    🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.

    669-1Évolution des étoiles sur les 7 derniers jours
  • EBT@alexiglad

    Code PyTorch pour le papier sur les Energy-Based Transformers -- raisonnement généralisable et apprentissage évolutif

    657+7Évolution des étoiles sur les 7 derniers jours
  • ✨✨Derniers articles et références sur le raisonnement avec les modèles de base

    657+1Évolution des étoiles sur les 7 derniers jours
  • Dernières avancées sur le raisonnement à longue chaîne de pensée (Long Chain-of-Thought)

    647-1Évolution des étoiles sur les 7 derniers jours
  • RandOpt@sunrainyg

    Code source officiel pour Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights (ICML 2026 Spotlight).

    642+2Évolution des étoiles sur les 7 derniers jours
  • VisualThinker-R1-Zero@turningpoint-ai

    Explorez le « moment Eurêka » multimodal sur le modèle 2B

    623+0Évolution des étoiles sur les 7 derniers jours
  • DeepPath@xwhan

    Code et documentation pour l'article EMNLP "DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning"

    562+0Évolution des étoiles sur les 7 derniers jours
  • TCS-NQT@ArkS0001
    551-1Évolution des étoiles sur les 7 derniers jours
  • Implémentation officielle de l'article ICLR 2024 : "Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning"

    532-1Évolution des étoiles sur les 7 derniers jours
  • QeRL@NVlabs

    [ICLR 2026] QeRL permet l'apprentissage par renforcement pour les LLM de 32B sur un seul GPU H100.

    518+2Évolution des étoiles sur les 7 derniers jours
  • Robust-R1@jqtangust

    🔥🔥🔥[Oral AAAI 2026] Implémentation officielle de Robust-R1 : Raisonnement conscient de la dégradation pour une compréhension visuelle robuste

    511+0Évolution des étoiles sur les 7 derniers jours
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets