rl
Repositori open source terpantau bertanda rl, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan rl di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda rl.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
Komunitas Llama bahasa Mandarin, mengumpulkan materi pembelajaran Llama terbaru secara real-time, membangun ekosistem open source model besar Llama bahasa Mandarin terbaik, sepenuhnya open source dan dapat digunakan secara komersial.
★ 14.740+1Perubahan bintang dalam 7 hari terakhir - #2★ 10.945+11Perubahan bintang dalam 7 hari terakhir
- #3
Dopamine adalah kerangka kerja penelitian untuk pembuatan prototipe algoritma reinforcement learning secara cepat
★ 10.901+4Perubahan bintang dalam 7 hari terakhir - #4
Agent Reinforcement Trainer: melatih agen multi-langkah untuk tugas dunia nyata menggunakan GRPO. Berikan pelatihan langsung kepada agen Anda. Reinforcement learning untuk Qwen3.6, GPT-OSS, Llama, dan banyak lagi!
★ 10.679+57Perubahan bintang dalam 7 hari terakhir - #5★ 5.703+19Perubahan bintang dalam 7 hari terakhir
- #6
EasyR1: Kerangka kerja pelatihan RL multi-modalitas yang efisien dan dapat diskalakan berdasarkan veRL.
★ 5.136+10Perubahan bintang dalam 7 hari terakhir - #7
Kurikulum praktis sumber terbuka yang menjembatani kesenjangan dari konsep dasar RL ke penyelarasan LLM, RLVR, dan sistem agen tingkat lanjut.
★ 4.145+94Perubahan bintang dalam 7 hari terakhir - #8
agent-sandbox memungkinkan pengelolaan beban kerja singleton yang terisolasi dan stateful dengan mudah, ideal untuk kasus penggunaan seperti runtime agen AI dan reinforcement learning (RL).
★ 3.678+92Perubahan bintang dalam 7 hari terakhir - #9
Implementasi algoritma AlphaZero untuk Gomoku (juga dikenal sebagai Gobang atau Five in a Row)
★ 3.625+2Perubahan bintang dalam 7 hari terakhir - #10
Library PyTorch yang modular, mengutamakan primitif, dan berbasis Python untuk Reinforcement Learning.
★ 3.540+12Perubahan bintang dalam 7 hari terakhir - #11
Kerangka kerja pelatihan untuk agen pembelajaran penguatan Stable Baselines3, termasuk optimasi hiperparameter dan agen yang telah dilatih sebelumnya.
★ 2.872+3Perubahan bintang dalam 7 hari terakhir - #12
Implementasi makalah dalam 100 baris kode.
★ 2.867+8Perubahan bintang dalam 7 hari terakhir - #13
MuZero
★ 2.863+4Perubahan bintang dalam 7 hari terakhir - #14
Survei Pembelajaran Penguatan untuk Model Penalaran Besar
★ 2.481+2Perubahan bintang dalam 7 hari terakhir - #15
Implementasi semua algoritma RL dengan cara yang lebih sederhana
★ 1.922+7Perubahan bintang dalam 7 hari terakhir - #16★ 1.872+3Perubahan bintang dalam 7 hari terakhir
- #17
[ICLR 2026] SimpleVLA-RL: Menskalakan pelatihan VLA melalui Reinforcement Learning
★ 1.839+9Perubahan bintang dalam 7 hari terakhir - #18
Kemajuan Terbaru dalam Penalaran System-2
★ 1.353+1Perubahan bintang dalam 7 hari terakhir - #19
Memahami Pelatihan Mirip R1-Zero: Perspektif Kritis
★ 1.274+1Perubahan bintang dalam 7 hari terakhir - #20
🎓 Kursus pembangunan Large Language Model yang sistematis | 🛠️ Mencakup teknik data pre-training, Tokenizer, Transformer, MoE, pemrograman GPU (CUDA/Triton), pelatihan terdistribusi, Scaling Laws, optimasi inferensi, dan alignment (SFT/RLHF/GRPO) | 🚀 6 tugas progresif + berbasis kode, membangun pemahaman tumpukan penuh LLM
★ 1.260+22Perubahan bintang dalam 7 hari terakhir - #21
[NeurIPS 2025] TTRL: Pembelajaran Penguatan Saat Waktu Pengujian (Test-Time Reinforcement Learning)
★ 1.121+5Perubahan bintang dalam 7 hari terakhir - #22★ 1.111+3Perubahan bintang dalam 7 hari terakhir
- #23★ 1.080+8Perubahan bintang dalam 7 hari terakhir
- #24
Stack Peningkatan Berkelanjutan untuk Agen. Data lingkungan dan evaluasi kami mendukung peningkatan dan pemantauan agen.
★ 1.058+1Perubahan bintang dalam 7 hari terakhir - #25
Tensorlake adalah runtime serverless untuk sandbox dan penerapan aplikasi agen latar belakang
★ 995+1Perubahan bintang dalam 7 hari terakhir - #26
Sistem Intelijen Risiko Berbasis AI, OpenDeRisk——Manajer risiko sistem aplikasi Anda yang memberikan perlindungan menyeluruh dan mendalam 7*24 jam.
★ 968+3Perubahan bintang dalam 7 hari terakhir - #27
Pustaka Python untuk Reinforcement Learning.
★ 944+1Perubahan bintang dalam 7 hari terakhir - #28
“AI-Compass” akan memandu komunitas dalam menavigasi lautan teknologi AI. Baik Anda pemula maupun pengembang tingkat lanjut, Anda dapat menemukan jalur ke berbagai arah AI di sini. Bertujuan untuk membantu pengembang memahami konsep inti AI, teknologi utama, dan tren terkini secara sistematis, serta menguasai seluruh proses dari teori hingga implementasi melalui praktik.
★ 926+12Perubahan bintang dalam 7 hari terakhir - #29
Platform robot humanoid open-source cetak 3D untuk simulasi-ke-nyata dan RL
★ 820+1Perubahan bintang dalam 7 hari terakhir - #30
MobileGym: Platform Simulasi yang Dapat Verifikasi dan Sangat Pararel untuk Penelitian Agen GUI Seluler · Simulator Android yang berjalan di browser · Simulator Android Berbasis Browser · Evaluasi yang Dapat Verifikasi · Pelatihan RL Online yang Dapat Skala
★ 777+10Perubahan bintang dalam 7 hari terakhir