본문으로 건너뛰기
buildradar
Sign in
토픽 · reasoning

reasoning

reasoning 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 56개
  • Search-o1@RUC-NLPIR

    🔍 Search-o1: 에이전트 기반 검색이 강화된 대규모 추론 모델 [EMNLP 2025]

    1,245+2최근 7일 스타 변화
  • DeepAgent@RUC-NLPIR

    [WWW‘26 Oral🔥] DeepAgent: 확장 가능한 툴셋을 갖춘 범용 추론 에이전트

    1,137+3최근 7일 스타 변화
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: 테스트 타임 강화 학습(Test-Time Reinforcement Learning)입니다.

    1,122+2최근 7일 스타 변화
  • SDPO@lasgroup

    자기 증류를 통한 강화학습 (SDPO)

    1,090+13최근 7일 스타 변화
  • Awesome-MCoT@yaotingwangofficial

    멀티모달 사고의 연쇄(Multimodal Chain-of-Thought) 추론: 종합 조사

    1,025+2최근 7일 스타 변화
  • ThoughtSource@OpenBioLink

    대형 언어 모델의 사고 łańcuch(chain-of-thought) 추론 관련 데이터 및 도구를 위한 중앙 집중형 오픈 리소스. Samwald 연구그룹 개발: https://samwald.info/

    1,015+0최근 7일 스타 변화
  • [ACL 2023] 언어 모델 프롬프팅을 활용한 추론에 관한 설문 조사

    1,007+1최근 7일 스타 변화
  • 대규모 깊이 순환 언어 모델을 위한 사전 학습 및 추론 코드

    942+31최근 7일 스타 변화
  • tutor-gpt@plastic-labs

    마음 이론(Theory-of-Mind) 추론 기반의 AI 튜터

    928+4최근 7일 스타 변화
  • [ACL 2026 KnowFM] 에이전트 기반 딥 리서치 관련 유용한 리소스 모음

    861+6최근 7일 스타 변화
  • self-refine@madaan

    LLM이 자신의 작업에 대한 피드백을 생성하고 이를 사용하여 출력을 개선하며 이 과정을 반복적으로 수행

    820+0최근 7일 스타 변화
  • Nucleoid@NucleoidAI

    LLM을 위한 논리 언어 🌱🐋 세계 모델 구축 🌍

    769+1최근 7일 스타 변화
  • mathcode@math-ai-org

    MathCode: 최첨단 수학 코딩 에이전트

    741+7최근 7일 스타 변화
  • golitex@litexlang

    Litex: 수학이 스스로를 검증하는 언어입니다.

    671+9최근 7일 스타 변화
  • oat@sail-sg

    OAT: 강화 학습, 선호도 학습 등을 포함하는 LLM 온라인 정렬을 위한 연구 친화적 프레임워크

    669-1최근 7일 스타 변화
  • EBT@alexiglad

    Energy-Based Transformers 논문을 위한 PyTorch 코드 - 일반화 가능한 추론 및 확장 가능한 학습

    657+7최근 7일 스타 변화
  • 파운데이션 모델의 추론 관련 최신 논문 및 벤치마크

    657+1최근 7일 스타 변화
  • Long Chain-of-Thought 추론의 최신 연구 동향

    647-1최근 7일 스타 변화
  • RandOpt@sunrainyg

    "Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights" (ICML 2026 Spotlight) 공식 코드베이스

    642+2최근 7일 스타 변화
  • VisualThinker-R1-Zero@turningpoint-ai

    2B 모델에서 멀티모달 '아하 모멘트(Aha Moment)' 탐색

    623+0최근 7일 스타 변화
  • DeepPath@xwhan

    EMNLP 논문 'DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning'의 코드 및 문서

    562+0최근 7일 스타 변화
  • TCS-NQT@ArkS0001
    551-1최근 7일 스타 변화
  • ICLR 2024 논문 'Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning' 공식 구현

    532-1최근 7일 스타 변화
  • QeRL@NVlabs

    [ICLR 2026] QeRL은 단일 H100 GPU에서 32B LLM을 위한 RL을 지원합니다.

    518+2최근 7일 스타 변화
  • Robust-R1@jqtangust

    [AAAI 2026 Oral] Robust-R1 공식 구현: 견고한 시각적 이해를 위한 열화 인식 추론

    511+0최근 7일 스타 변화
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501최근 7일 스타 변화
← 토픽 목록으로