reasoning
Repositori open source terpantau bertanda reasoning, diurutkan berdasarkan bintang.
- #31
🔍 Search-o1: Model Penalaran Besar yang Ditingkatkan Pencarian Berbasis Agen [EMNLP 2025]
★ 1.245+2Perubahan bintang dalam 7 hari terakhir - #32
[WWW‘26 Oral🔥] DeepAgent: Agent Penalaran Umum dengan Set Alat yang Dapat Diskalakan
★ 1.137+3Perubahan bintang dalam 7 hari terakhir - #33
[NeurIPS 2025] TTRL: Pembelajaran Penguatan Saat Waktu Pengujian (Test-Time Reinforcement Learning)
★ 1.122+1Perubahan bintang dalam 7 hari terakhir - #34★ 1.090+11Perubahan bintang dalam 7 hari terakhir
- #35
Penalaran Multimodal Chain-of-Thought: Survei Komprehensif
★ 1.025+2Perubahan bintang dalam 7 hari terakhir - #36
Sumber daya terbuka terpusat untuk data dan alat yang berkaitan dengan penalaran chain-of-thought dalam model bahasa besar. Dikembangkan oleh grup riset Samwald: https://samwald.info/
★ 1.015+0Perubahan bintang dalam 7 hari terakhir - #37
[ACL 2023] Penalaran dengan Prompting Model Bahasa: Sebuah Survei
★ 1.007+1Perubahan bintang dalam 7 hari terakhir - #38
Kode pretraining dan inferensi untuk model bahasa depth-recurrent skala besar
★ 942+22Perubahan bintang dalam 7 hari terakhir - #39★ 928+4Perubahan bintang dalam 7 hari terakhir
- #40
[ACL 2026 KnowFM] Sumber Daya Riset Mendalam Berbasis Agen yang Keren
★ 861+6Perubahan bintang dalam 7 hari terakhir - #41
LLM dapat menghasilkan umpan balik atas pekerjaan mereka, menggunakannya untuk meningkatkan output, dan mengulangi proses ini secara iteratif.
★ 820+0Perubahan bintang dalam 7 hari terakhir - #42★ 769+1Perubahan bintang dalam 7 hari terakhir
- #43★ 741+6Perubahan bintang dalam 7 hari terakhir
- #44★ 671+10Perubahan bintang dalam 7 hari terakhir
- #45
OAT: Framework yang ramah riset untuk penyelarasan daring LLM, mencakup reinforcement learning, preference learning, dan lainnya.
★ 669-1Perubahan bintang dalam 7 hari terakhir - #46
Kode PyTorch untuk makalah Energy-Based Transformers -- penalaran yang dapat digeneralisasi dan pembelajaran yang dapat menskalakan
★ 657+5Perubahan bintang dalam 7 hari terakhir - #47
✨✨Makalah dan tolok ukur terbaru dalam penalaran dengan Foundation Models
★ 657+0Perubahan bintang dalam 7 hari terakhir - #48
Kemajuan Terbaru dalam Penalaran Rantai Pemikiran Panjang
★ 647-1Perubahan bintang dalam 7 hari terakhir - #49
Basis Kode Resmi untuk "Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights" (ICML 2026 Spotlight)
★ 642+2Perubahan bintang dalam 7 hari terakhir - #50
Jelajahi “Aha Moment” Multimodal pada Model 2B
★ 623+0Perubahan bintang dalam 7 hari terakhir - #51
Kode dan dokumentasi untuk makalah EMNLP "DeepPath: A Reinforcement Learning Method for Knowledge Graph Reasoning"
★ 562+0Perubahan bintang dalam 7 hari terakhir - #52★ 552-1Perubahan bintang dalam 7 hari terakhir
- #53
Implementasi resmi dari makalah ICLR 2024: "Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning"
★ 532-1Perubahan bintang dalam 7 hari terakhir - #54★ 518+2Perubahan bintang dalam 7 hari terakhir
- #55
🔥🔥🔥[AAAI 2026 Oral] Implementasi Resmi dari Robust-R1: Penalaran Sadar Degradasi untuk Pemahaman Visual yang Robust
★ 511+0Perubahan bintang dalam 7 hari terakhir - #56
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Perubahan bintang dalam 7 hari terakhir