Zum Hauptinhalt springen
buildradar
Sign in
Thema · reasoning

reasoning

Erfasste Open-Source-Repos mit dem Tag reasoning, sortiert nach Sternen.

56 Repos
  • Search-o1@RUC-NLPIR

    🔍 Search-o1: Agentenbasierte, durch Suche erweiterte große Reasoning-Modelle [EMNLP 2025]

    1.245+2Sterne-Änderung der letzten 7 Tage
  • DeepAgent@RUC-NLPIR

    [WWW‘26 Oral🔥] DeepAgent: Ein allgemeiner Reasoning-Agent mit skalierbaren Werkzeugsätzen

    1.137+3Sterne-Änderung der letzten 7 Tage
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: Test-Time Reinforcement Learning

    1.121+1Sterne-Änderung der letzten 7 Tage
  • SDPO@lasgroup

    Reinforcement Learning via Self-Distillation (SDPO)

    1.088+11Sterne-Änderung der letzten 7 Tage
  • Awesome-MCoT@yaotingwangofficial

    Multimodal Chain-of-Thought Reasoning: Eine umfassende Übersicht

    1.025+2Sterne-Änderung der letzten 7 Tage
  • ThoughtSource@OpenBioLink

    Eine zentrale, offene Ressource für Daten und Tools rund um Chain-of-Thought-Reasoning in großen Sprachmodellen. Entwickelt von der Samwald Research Group: https://samwald.info/

    1.015+0Sterne-Änderung der letzten 7 Tage
  • [ACL 2023] Reasoning with Language Model Prompting: A Survey

    1.007+1Sterne-Änderung der letzten 7 Tage
  • Pretraining- und Inferenz-Code für ein großflächiges, tiefenrekurrentes Sprachmodell

    933+22Sterne-Änderung der letzten 7 Tage
  • tutor-gpt@plastic-labs

    KI-Tutor, angetrieben von Theory-of-Mind-Schlussfolgerungen

    928+4Sterne-Änderung der letzten 7 Tage
  • [ACL 2026 KnowFM] Großartige Ressourcen für agentische Deep Research

    861+6Sterne-Änderung der letzten 7 Tage
  • self-refine@madaan

    LLMs können Feedback zu ihrer Arbeit generieren, dieses zur Verbesserung der Ausgabe nutzen und diesen Prozess iterativ wiederholen.

    820+0Sterne-Änderung der letzten 7 Tage
  • Nucleoid@NucleoidAI

    Logiksprache für LLMs 🌱🐋 Weltmodelle erstellen 🌍

    769+1Sterne-Änderung der letzten 7 Tage
  • mathcode@math-ai-org

    MathCode: Ein bahnbrechender Agent für mathematisches Programmieren.

    740+6Sterne-Änderung der letzten 7 Tage
  • golitex@litexlang

    Litex: Die Sprache, in der sich Mathematik selbst verifiziert.

    672+10Sterne-Änderung der letzten 7 Tage
  • oat@sail-sg

    OAT: Ein forschungsfreundliches Framework für das Online-Alignment von LLMs, einschließlich Reinforcement Learning, Präferenzlernen usw.

    669-1Sterne-Änderung der letzten 7 Tage
  • ✨✨ Neueste Papers und Benchmarks zum Reasoning mit Foundation Models

    656+0Sterne-Änderung der letzten 7 Tage
  • EBT@alexiglad

    PyTorch-Code für das Paper zu Energy-Based Transformers -- verallgemeinerbare Logik und skalierbares Lernen

    655+5Sterne-Änderung der letzten 7 Tage
  • Neueste Fortschritte beim Long Chain-of-Thought Reasoning

    647-1Sterne-Änderung der letzten 7 Tage
  • RandOpt@sunrainyg

    Offizielle Codebasis für „Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights“ (ICML 2026 Spotlight)

    642+2Sterne-Änderung der letzten 7 Tage
  • VisualThinker-R1-Zero@turningpoint-ai

    Erkunden Sie den multimodalen „Aha-Moment“ am 2B-Modell.

    623+0Sterne-Änderung der letzten 7 Tage
  • DeepPath@xwhan

    Code und Dokumentation für das EMNLP-Paper DeepPath: Eine Reinforcement-Learning-Methode für Knowledge-Graph-Reasoning

    562+0Sterne-Änderung der letzten 7 Tage
  • TCS-NQT@ArkS0001
    552-1Sterne-Änderung der letzten 7 Tage
  • Offizielle Implementierung des ICLR 2024-Papers: "Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning"

    532-1Sterne-Änderung der letzten 7 Tage
  • QeRL@NVlabs

    [ICLR 2026] QeRL ermöglicht RL für 32B LLMs auf einer einzelnen H100 GPU.

    518+2Sterne-Änderung der letzten 7 Tage
  • Robust-R1@jqtangust

    Offizielle Implementierung von Robust-R1: Degradationsbewusstes Schlussfolgern für robustes visuelles Verständnis [AAAI 2026 Oral]

    511+0Sterne-Änderung der letzten 7 Tage
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen