跳到主要内容
buildradar
Sign in
主题 · reasoning

reasoning

标记 reasoning 主题、收录中的开源项目,按星标数排序。

共 56 个项目
  • Search-o1@RUC-NLPIR

    🔍 Search-o1:具备代理搜索增强的大型推理模型 [EMNLP 2025]

    1,245+2近 7 天星标变化
  • DeepAgent@RUC-NLPIR

    [WWW‘26 Oral🔥] DeepAgent: 具备可扩展工具集的通用推理代理

    1,137+3近 7 天星标变化
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL:测试期强化学习

    1,123+2近 7 天星标变化
  • SDPO@lasgroup

    通过自我蒸馏的强化学习(SDPO)

    1,093+15近 7 天星标变化
  • Awesome-MCoT@yaotingwangofficial

    多模态思维链推理:综合调查

    1,025+2近 7 天星标变化
  • ThoughtSource@OpenBioLink

    大型语言模型中思维链推理相关数据与工具的中央开源资源。由 Samwald 研究群开发:https://samwald.info/

    1,015+0近 7 天星标变化
  • [ACL 2023] 语言模型提示词推理综述

    1,007+1近 7 天星标变化
  • 大规模深度递归语言模型的预训练与推理代码

    949+34近 7 天星标变化
  • tutor-gpt@plastic-labs

    由心理理论(Theory-of-Mind)推理驱动的 AI 家教

    929+4近 7 天星标变化
  • [ACL 2026 KnowFM] 实用的 Agentic Deep Research 资源整理

    861+6近 7 天星标变化
  • self-refine@madaan

    LLM 可以针对自己的工作生成反馈,利用反馈改进输出,并以迭代方式重复此过程。

    820+0近 7 天星标变化
  • Nucleoid@NucleoidAI

    LLM 的逻辑语言 🌱🐋 建立世界模型 🌍

    769+1近 7 天星标变化
  • mathcode@math-ai-org

    MathCode:前沿的数学代码智能体

    742+8近 7 天星标变化
  • golitex@litexlang

    Litex:数学自我验证的语言。

    672+10近 7 天星标变化
  • oat@sail-sg

    🌾 OAT:一个对研究友好的 LLM 在线对齐框架,包含强化学习、偏好学习等。

    669-1近 7 天星标变化
  • EBT@alexiglad

    Energy-Based Transformers 论文的 PyTorch 代码 -- 可推广的推理与可扩展的学习

    659+8近 7 天星标变化
  • ✨✨基础模型推理最新论文与基准测试

    657+1近 7 天星标变化
  • 长思维链推理的最新进展

    647-1近 7 天星标变化
  • RandOpt@sunrainyg

    “Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights”(ICML 2026 Spotlight)官方代码库。

    644+3近 7 天星标变化
  • VisualThinker-R1-Zero@turningpoint-ai

    探索 2B 模型上的多模态“Aha 时刻”

    623+0近 7 天星标变化
  • DeepPath@xwhan

    EMNLP 论文“DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning”的代码与文档

    562+0近 7 天星标变化
  • TCS-NQT@ArkS0001
    553-2近 7 天星标变化
  • ICLR 2024 论文“Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning”官方实现。

    532-1近 7 天星标变化
  • QeRL@NVlabs

    [ICLR 2026] QeRL 支持在单张 H100 GPU 上对 32B LLM 进行强化学习

    518+2近 7 天星标变化
  • Robust-R1@jqtangust

    🔥🔥🔥[AAAI 2026 Oral] Robust-R1 官方实现:用于稳健视觉理解的降级感知推理

    511+0近 7 天星标变化
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    502近 7 天星标变化
← 返回主题列表