跳到主要內容
buildradar
Sign in
主題 · reasoning

reasoning

標記 reasoning 主題、收錄中的開源專案,依星數排序。

共 56 個專案
  • Search-o1@RUC-NLPIR

    🔍 Search-o1:具備代理搜尋增強的大型推理模型 [EMNLP 2025]

    1,245+4近 7 天星數變化
  • DeepAgent@RUC-NLPIR

    [WWW‘26 Oral🔥] DeepAgent: 具備可擴充工具集的通用推理代理

    1,137+4近 7 天星數變化
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL:測試期強化學習

    1,121+1近 7 天星數變化
  • SDPO@lasgroup

    透過自我蒸餾的強化學習(SDPO)

    1,088+7近 7 天星數變化
  • Awesome-MCoT@yaotingwangofficial

    多模態思維鏈推理:綜合調查

    1,025+1近 7 天星數變化
  • ThoughtSource@OpenBioLink

    大型語言模型中思維鏈推理相關資料與工具的中央開源資源。由 Samwald 研究群開發:https://samwald.info/

    1,015+0近 7 天星數變化
  • [ACL 2023] 語言模型提示詞推理綜述

    1,007+1近 7 天星數變化
  • 大規模深度遞歸語言模型的預訓練與推論程式碼

    933+5近 7 天星數變化
  • tutor-gpt@plastic-labs

    由心智理論(Theory-of-Mind)推理驅動的 AI 家教

    928+3近 7 天星數變化
  • [ACL 2026 KnowFM] 實用的 Agentic Deep Research 資源整理

    861+3近 7 天星數變化
  • self-refine@madaan

    LLM 可以針對自己的工作產生回饋,利用回饋改進輸出,並以迭代方式重複此過程。

    820+2近 7 天星數變化
  • Nucleoid@NucleoidAI

    LLM 的邏輯語言 🌱🐋 建立世界模型 🌍

    769+1近 7 天星數變化
  • mathcode@math-ai-org

    MathCode:前沿的數學程式碼代理程式

    740+3近 7 天星數變化
  • golitex@litexlang

    Litex:數學自我驗證的語言。

    672+7近 7 天星數變化
  • oat@sail-sg

    🌾 OAT:一個對研究友善的 LLM 線上對齊框架,包含強化學習、偏好學習等。

    669-1近 7 天星數變化
  • ✨✨基礎模型推理最新論文與基準測試

    656+1近 7 天星數變化
  • EBT@alexiglad

    Energy-Based Transformers 論文的 PyTorch 程式碼 -- 可推廣的推理與可擴展的學習

    655+5近 7 天星數變化
  • 長思考鏈推理的最新進展

    647+0近 7 天星數變化
  • RandOpt@sunrainyg

    「Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights」(ICML 2026 Spotlight)官方程式碼庫。

    642+0近 7 天星數變化
  • VisualThinker-R1-Zero@turningpoint-ai

    探索 2B 模型上的多模態「Aha 時刻」

    623+0近 7 天星數變化
  • DeepPath@xwhan

    EMNLP 論文「DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning」的程式碼與文件

    562+0近 7 天星數變化
  • TCS-NQT@ArkS0001
    552+0近 7 天星數變化
  • ICLR 2024 論文「Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning」官方實作。

    532-1近 7 天星數變化
  • QeRL@NVlabs

    [ICLR 2026] QeRL 支援在單張 H100 GPU 上對 32B LLM 進行強化學習

    518+2近 7 天星數變化
  • Robust-R1@jqtangust

    🔥🔥🔥[AAAI 2026 Oral] Robust-R1 官方實作:用於穩健視覺理解的降級感知推理

    511+0近 7 天星數變化
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501近 7 天星數變化
← 返回主題列表