Saltar al contenido principal
buildradar
Sign in
Tema · reasoning

reasoning

Repositorios de código abierto monitorizados etiquetados con reasoning, ordenados por estrellas.

56 repositorios
  • Search-o1@RUC-NLPIR

    Search-o1: Modelos de razonamiento grande con búsqueda mejorada mediante agentes [EMNLP 2025]

    1245+2Variación de estrellas de los últimos 7 días
  • DeepAgent@RUC-NLPIR

    [WWW‘26 Oral🔥] DeepAgent: Un agente de razonamiento general con conjuntos de herramientas escalables

    1137+3Variación de estrellas de los últimos 7 días
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: Aprendizaje por refuerzo en tiempo de prueba

    1122+1Variación de estrellas de los últimos 7 días
  • SDPO@lasgroup

    Aprendizaje por refuerzo mediante autodestilación (SDPO)

    1090+11Variación de estrellas de los últimos 7 días
  • Awesome-MCoT@yaotingwangofficial

    Razonamiento multimodal de cadena de pensamiento: un estudio exhaustivo

    1025+2Variación de estrellas de los últimos 7 días
  • ThoughtSource@OpenBioLink

    Un recurso central y abierto para datos y herramientas relacionados con el razonamiento de cadena de pensamientos en modelos de lenguaje grandes. Desarrollado en el grupo de investigación de Samwald: https://samwald.info/

    1015+0Variación de estrellas de los últimos 7 días
  • [ACL 2023] Razonamiento con prompting de modelos de lenguaje: un estudio.

    1007+1Variación de estrellas de los últimos 7 días
  • Código de preentrenamiento e inferencia para un modelo de lenguaje recurrente de profundidad a gran escala

    942+22Variación de estrellas de los últimos 7 días
  • tutor-gpt@plastic-labs

    Tutor de IA basado en razonamiento de Teoría de la Mente

    928+4Variación de estrellas de los últimos 7 días
  • [ACL 2026 KnowFM] Recursos increíbles sobre investigación profunda con agentes

    861+6Variación de estrellas de los últimos 7 días
  • self-refine@madaan

    Los LLM pueden generar comentarios sobre su propio trabajo, utilizarlos para mejorar el resultado y repetir este proceso de forma iterativa.

    820+0Variación de estrellas de los últimos 7 días
  • Nucleoid@NucleoidAI

    Lenguaje lógico para LLMs 🌱🐋 Construye modelos del mundo 🌍

    769+1Variación de estrellas de los últimos 7 días
  • mathcode@math-ai-org

    MathCode: Un agente de codificación matemática de vanguardia

    741+6Variación de estrellas de los últimos 7 días
  • golitex@litexlang

    Litex: El lenguaje donde las matemáticas se verifican a sí mismas.

    671+10Variación de estrellas de los últimos 7 días
  • oat@sail-sg

    🌾 OAT: Un marco de trabajo amigable para la investigación de alineación en línea de LLM, que incluye aprendizaje por refuerzo, aprendizaje de preferencias, etc.

    669-1Variación de estrellas de los últimos 7 días
  • EBT@alexiglad

    Código de PyTorch para el artículo Energy-Based Transformers: razonamiento generalizable y aprendizaje escalable

    657+5Variación de estrellas de los últimos 7 días
  • ✨✨Últimos artículos y benchmarks sobre razonamiento con modelos base

    657+0Variación de estrellas de los últimos 7 días
  • Últimos avances en razonamiento de cadena de pensamiento larga (Long Chain-of-Thought)

    647-1Variación de estrellas de los últimos 7 días
  • RandOpt@sunrainyg

    Repositorio oficial para "Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights" (ICML 2026 Spotlight)

    642+2Variación de estrellas de los últimos 7 días
  • VisualThinker-R1-Zero@turningpoint-ai

    Explora el momento "Aha" multimodal en un modelo de 2B.

    623+0Variación de estrellas de los últimos 7 días
  • DeepPath@xwhan

    Código y documentación para el artículo de EMNLP "DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning".

    562+0Variación de estrellas de los últimos 7 días
  • TCS-NQT@ArkS0001
    552-1Variación de estrellas de los últimos 7 días
  • Implementación oficial del artículo de ICLR 2024: "Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning"

    532-1Variación de estrellas de los últimos 7 días
  • QeRL@NVlabs

    [ICLR 2026] QeRL permite RL para LLMs de 32B en una sola GPU H100

    518+2Variación de estrellas de los últimos 7 días
  • Robust-R1@jqtangust

    🔥🔥🔥 [AAAI 2026 Oral] Implementación oficial de Robust-R1: Razonamiento consciente de la degradación para una comprensión visual robusta

    511+0Variación de estrellas de los últimos 7 días
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Variación de estrellas de los últimos 7 días
← Volver a temas