reasoning
Dépôts open source suivis étiquetés reasoning, triés par étoiles.
- #31
🔍 Search-o1 : Modèles de raisonnement large améliorés par la recherche agentique [EMNLP 2025]
★ 1 245+2Évolution des étoiles sur les 7 derniers jours - #32
[WWW‘26 Oral🔥] DeepAgent : un agent de raisonnement général avec des ensembles d'outils évolutifs.
★ 1 137+3Évolution des étoiles sur les 7 derniers jours - #33
[NeurIPS 2025] TTRL : Apprentissage par renforcement en temps de test (Test-Time Reinforcement Learning).
★ 1 122+2Évolution des étoiles sur les 7 derniers jours - #34★ 1 090+13Évolution des étoiles sur les 7 derniers jours
- #35
Raisonnement multimodal par chaîne de pensée : une étude complète
★ 1 025+2Évolution des étoiles sur les 7 derniers jours - #36
Ressource centrale et ouverte pour les données et outils liés au raisonnement par chaîne de pensée (chain-of-thought) dans les grands modèles de langage. Développé par le groupe de recherche Samwald.
★ 1 015+0Évolution des étoiles sur les 7 derniers jours - #37
[ACL 2023] Raisonnement par prompting de modèles de langage : une étude
★ 1 007+1Évolution des étoiles sur les 7 derniers jours - #38
Code de pré-entraînement et d'inférence pour un modèle de langage récurrent en profondeur à grande échelle.
★ 942+31Évolution des étoiles sur les 7 derniers jours - #39★ 928+4Évolution des étoiles sur les 7 derniers jours
- #40
[ACL 2026 KnowFM] Ressources impressionnantes sur la recherche approfondie par agents.
★ 861+6Évolution des étoiles sur les 7 derniers jours - #41
Les LLM peuvent générer des retours sur leur propre travail, les utiliser pour améliorer le résultat et répéter ce processus de manière itérative.
★ 820+0Évolution des étoiles sur les 7 derniers jours - #42★ 769+1Évolution des étoiles sur les 7 derniers jours
- #43★ 741+7Évolution des étoiles sur les 7 derniers jours
- #44★ 671+9Évolution des étoiles sur les 7 derniers jours
- #45
🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.
★ 669-1Évolution des étoiles sur les 7 derniers jours - #46
Code PyTorch pour le papier sur les Energy-Based Transformers -- raisonnement généralisable et apprentissage évolutif
★ 657+7Évolution des étoiles sur les 7 derniers jours - #47
✨✨Derniers articles et références sur le raisonnement avec les modèles de base
★ 657+1Évolution des étoiles sur les 7 derniers jours - #48
Dernières avancées sur le raisonnement à longue chaîne de pensée (Long Chain-of-Thought)
★ 647-1Évolution des étoiles sur les 7 derniers jours - #49
Code source officiel pour Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights (ICML 2026 Spotlight).
★ 642+2Évolution des étoiles sur les 7 derniers jours - #50
Explorez le « moment Eurêka » multimodal sur le modèle 2B
★ 623+0Évolution des étoiles sur les 7 derniers jours - #51
Code et documentation pour l'article EMNLP "DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning"
★ 562+0Évolution des étoiles sur les 7 derniers jours - #52★ 551-1Évolution des étoiles sur les 7 derniers jours
- #53
Implémentation officielle de l'article ICLR 2024 : "Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning"
★ 532-1Évolution des étoiles sur les 7 derniers jours - #54
[ICLR 2026] QeRL permet l'apprentissage par renforcement pour les LLM de 32B sur un seul GPU H100.
★ 518+2Évolution des étoiles sur les 7 derniers jours - #55
🔥🔥🔥[Oral AAAI 2026] Implémentation officielle de Robust-R1 : Raisonnement conscient de la dégradation pour une compréhension visuelle robuste
★ 511+0Évolution des étoiles sur les 7 derniers jours - #56
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Évolution des étoiles sur les 7 derniers jours