Lompat ke konten utama
buildradar
Sign in
Topik · reasoning

reasoning

Repositori open source terpantau bertanda reasoning, diurutkan berdasarkan bintang.

56 repositori
  • Search-o1@RUC-NLPIR

    🔍 Search-o1: Model Penalaran Besar yang Ditingkatkan Pencarian Berbasis Agen [EMNLP 2025]

    1.245+2Perubahan bintang dalam 7 hari terakhir
  • DeepAgent@RUC-NLPIR

    [WWW‘26 Oral🔥] DeepAgent: Agent Penalaran Umum dengan Set Alat yang Dapat Diskalakan

    1.137+3Perubahan bintang dalam 7 hari terakhir
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: Pembelajaran Penguatan Saat Waktu Pengujian (Test-Time Reinforcement Learning)

    1.122+1Perubahan bintang dalam 7 hari terakhir
  • SDPO@lasgroup

    Reinforcement Learning via Self-Distillation (SDPO)

    1.090+11Perubahan bintang dalam 7 hari terakhir
  • Awesome-MCoT@yaotingwangofficial

    Penalaran Multimodal Chain-of-Thought: Survei Komprehensif

    1.025+2Perubahan bintang dalam 7 hari terakhir
  • ThoughtSource@OpenBioLink

    Sumber daya terbuka terpusat untuk data dan alat yang berkaitan dengan penalaran chain-of-thought dalam model bahasa besar. Dikembangkan oleh grup riset Samwald: https://samwald.info/

    1.015+0Perubahan bintang dalam 7 hari terakhir
  • [ACL 2023] Penalaran dengan Prompting Model Bahasa: Sebuah Survei

    1.007+1Perubahan bintang dalam 7 hari terakhir
  • Kode pretraining dan inferensi untuk model bahasa depth-recurrent skala besar

    942+22Perubahan bintang dalam 7 hari terakhir
  • tutor-gpt@plastic-labs

    Tutor AI yang didukung oleh penalaran Theory-of-Mind

    928+4Perubahan bintang dalam 7 hari terakhir
  • [ACL 2026 KnowFM] Sumber Daya Riset Mendalam Berbasis Agen yang Keren

    861+6Perubahan bintang dalam 7 hari terakhir
  • self-refine@madaan

    LLM dapat menghasilkan umpan balik atas pekerjaan mereka, menggunakannya untuk meningkatkan output, dan mengulangi proses ini secara iteratif.

    820+0Perubahan bintang dalam 7 hari terakhir
  • Nucleoid@NucleoidAI

    Bahasa Logika untuk LLM 🌱🐋 Bangun Model Dunia 🌍

    769+1Perubahan bintang dalam 7 hari terakhir
  • mathcode@math-ai-org

    MathCode: Agen pengodean matematika terdepan

    741+6Perubahan bintang dalam 7 hari terakhir
  • golitex@litexlang

    Litex: Bahasa di mana matematika memverifikasi dirinya sendiri.

    671+10Perubahan bintang dalam 7 hari terakhir
  • oat@sail-sg

    OAT: Framework yang ramah riset untuk penyelarasan daring LLM, mencakup reinforcement learning, preference learning, dan lainnya.

    669-1Perubahan bintang dalam 7 hari terakhir
  • EBT@alexiglad

    Kode PyTorch untuk makalah Energy-Based Transformers -- penalaran yang dapat digeneralisasi dan pembelajaran yang dapat menskalakan

    657+5Perubahan bintang dalam 7 hari terakhir
  • ✨✨Makalah dan tolok ukur terbaru dalam penalaran dengan Foundation Models

    657+0Perubahan bintang dalam 7 hari terakhir
  • Kemajuan Terbaru dalam Penalaran Rantai Pemikiran Panjang

    647-1Perubahan bintang dalam 7 hari terakhir
  • RandOpt@sunrainyg

    Basis Kode Resmi untuk "Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights" (ICML 2026 Spotlight)

    642+2Perubahan bintang dalam 7 hari terakhir
  • VisualThinker-R1-Zero@turningpoint-ai

    Jelajahi “Aha Moment” Multimodal pada Model 2B

    623+0Perubahan bintang dalam 7 hari terakhir
  • DeepPath@xwhan

    Kode dan dokumentasi untuk makalah EMNLP "DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning"

    562+0Perubahan bintang dalam 7 hari terakhir
  • TCS-NQT@ArkS0001
    552-1Perubahan bintang dalam 7 hari terakhir
  • Implementasi resmi dari makalah ICLR 2024: "Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning"

    532-1Perubahan bintang dalam 7 hari terakhir
  • QeRL@NVlabs

    [ICLR 2026] QeRL memungkinkan RL untuk LLM 32B pada satu GPU H100.

    518+2Perubahan bintang dalam 7 hari terakhir
  • Robust-R1@jqtangust

    🔥🔥🔥[AAAI 2026 Oral] Implementasi Resmi dari Robust-R1: Penalaran Sadar Degradasi untuk Pemahaman Visual yang Robust

    511+0Perubahan bintang dalam 7 hari terakhir
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik