reinforcement-learning
Repositori open source terpantau bertanda reinforcement-learning, diurutkan berdasarkan bintang.
- #31
Vowpal Wabbit adalah sistem pembelajaran mesin yang mendorong batas pembelajaran mesin dengan teknik seperti online, hashing, allreduce, reductions, learning2search, active, dan interactive learning.
★ 8.708+2Perubahan bintang dalam 7 hari terakhir - #32★ 8.309+2Perubahan bintang dalam 7 hari terakhir
- #33
Implementasi RLHF (Reinforcement Learning with Human Feedback) di atas arsitektur PaLM. Pada dasarnya seperti ChatGPT tetapi menggunakan PaLM
★ 7.866-1Perubahan bintang dalam 7 hari terakhir - #34
Menjadi peneliti/insinyur AI/ML yang mahir dengan buku teks tidak konvensional yang mencakup matematika, komputasi, dan ML dengan pendekatan intuitif.
★ 7.400+21Perubahan bintang dalam 7 hari terakhir - #35
Daftar bacaan untuk topik penelitian dalam machine learning multimodal.
★ 6.926+1Perubahan bintang dalam 7 hari terakhir - #36
Kumpulan makalah, blog, dan proyek LLM, dengan fokus pada OpenAI o1 🍓 dan teknik penalaran.
★ 6.902+3Perubahan bintang dalam 7 hari terakhir - #37
Kursus pembelajaran penguatan (reinforcement learning) di lapangan.
★ 6.566+0Perubahan bintang dalam 7 hari terakhir - #38
🔬 Daftar pilihan LLM, strategi deep learning & alat luar biasa di pasar keuangan.
★ 6.475+23Perubahan bintang dalam 7 hari terakhir - #39
Mooncake adalah platform layanan untuk Kimi, layanan LLM terkemuka yang disediakan oleh Moonshot AI.
★ 6.470+40Perubahan bintang dalam 7 hari terakhir - #40
Daftar terkurasi dari metode self-supervised yang luar biasa
★ 6.414+1Perubahan bintang dalam 7 hari terakhir - #41★ 6.321+8Perubahan bintang dalam 7 hari terakhir
- #42★ 6.018+4Perubahan bintang dalam 7 hari terakhir
- #43★ 5.813+5Perubahan bintang dalam 7 hari terakhir
- #44★ 5.712+9Perubahan bintang dalam 7 hari terakhir
- #45
OpenSpiel adalah koleksi lingkungan dan algoritma untuk penelitian dalam reinforcement learning umum serta pencarian/perencanaan dalam permainan.
★ 5.452+8Perubahan bintang dalam 7 hari terakhir - #46
Framework robot peliharaan berkaki empat sumber terbuka untuk mengembangkan robot berkaki empat gaya Boston Dynamics yang sempurna untuk STEM, pendidikan coding & robotika, aplikasi robotika IoT, layanan aplikasi robotika yang diperkaya AI, penelitian, dan pengembangan kit robotika DIY.
★ 5.246+15Perubahan bintang dalam 7 hari terakhir - #47
Mesin pelatihan generasi berikutnya yang dibangun untuk model MoE skala ultra-besar.
★ 5.188+3Perubahan bintang dalam 7 hari terakhir - #48
Repositori untuk program Nanodegree Deep Reinforcement Learning.
★ 5.176+0Perubahan bintang dalam 7 hari terakhir - #49
EasyR1: Kerangka kerja pelatihan RL multi-modalitas yang efisien dan dapat diskalakan berdasarkan veRL.
★ 5.141+5Perubahan bintang dalam 7 hari terakhir - #50
Mengimplementasikan penalaran LLM di PyTorch dari awal, langkah demi langkah.
★ 5.138+49Perubahan bintang dalam 7 hari terakhir - #51
Repositori ini berisi kursus Deep Reinforcement Learning dari Hugging Face.
★ 5.006+10Perubahan bintang dalam 7 hari terakhir - #52
100+ peta algoritma LLM / RL orisinal, karya penulis 《大模型算法》.
★ 4.838+12Perubahan bintang dalam 7 hari terakhir - #53
Repositori untuk pelatihan terdistribusi model bahasa dengan Reinforcement Learning via Human Feedback (RLHF).
★ 4.754-1Perubahan bintang dalam 7 hari terakhir - #54★ 4.705+31Perubahan bintang dalam 7 hari terakhir
- #55
Tumpukan perangkat lunak Google DeepMind untuk simulasi berbasis fisika dan lingkungan Reinforcement Learning, menggunakan MuJoCo.
★ 4.681+6Perubahan bintang dalam 7 hari terakhir - #56
[ICML 2021] DouZero: Menguasai DouDizhu dengan Deep Reinforcement Learning Berbasis Self-Play | AI DouDizhu
★ 4.659+5Perubahan bintang dalam 7 hari terakhir - #57
Implementasi bersih berbasis AlphaZero untuk game apa pun di framework apa pun + tutorial + Othello/Gobang/TicTacToe/Connect4 dan lainnya
★ 4.512+5Perubahan bintang dalam 7 hari terakhir - #58
Daftar kurasi sumber daya reinforcement learning with human feedback (diperbarui secara berkala).
★ 4.424+2Perubahan bintang dalam 7 hari terakhir - #59★ 4.359+2Perubahan bintang dalam 7 hari terakhir
- #60
Kurikulum praktis sumber terbuka yang menjembatani kesenjangan dari konsep dasar RL ke penyelarasan LLM, RLVR, dan sistem agen tingkat lanjut.
★ 4.199+54Perubahan bintang dalam 7 hari terakhir