reinforcement-learning
Repositori open source terpantau bertanda reinforcement-learning, diurutkan berdasarkan bintang.
- #211
Kode untuk "TD-MPC2: Model Dunia yang Dapat Skala dan Tangguh untuk Kontrol Kontinu"
★ 943+4Perubahan bintang dalam 7 hari terakhir - #212★ 935+15Perubahan bintang dalam 7 hari terakhir
- #213
🦁 Basis kode yang ramah penelitian untuk eksperimen cepat pembelajaran penguatan multi-agen (multi-agent reinforcement learning) di JAX
★ 934+2Perubahan bintang dalam 7 hari terakhir - #214
Platform Multi-Agent Resource Optimization (MARO) adalah instansiasi dari Reinforcement Learning as a Service (RaaS) untuk masalah optimasi sumber daya dunia nyata.
★ 923+2Perubahan bintang dalam 7 hari terakhir - #215
Ringkasan makalah dan blog utama tentang diffusion models untuk mempelajari topik tersebut. Daftar terperinci dari semua makalah robotics diffusion yang diterbitkan.
★ 920+1Perubahan bintang dalam 7 hari terakhir - #216★ 918+20Perubahan bintang dalam 7 hari terakhir
- #217
Lingkungan PyBullet CartPole dan Quadrotor—dengan dinamika a priori simbolik CasADi—untuk kontrol berbasis pembelajaran dan RL
★ 917+2Perubahan bintang dalam 7 hari terakhir - #218
Daftar kurasi sumber daya Decision Transformer (diperbarui terus-menerus)
★ 916+0Perubahan bintang dalam 7 hari terakhir - #219
👉 Sumber daya CARLA seperti tutorial, blog, kode, dan lainnya https://github.com/carla-simulator/carla
★ 915-1Perubahan bintang dalam 7 hari terakhir - #220★ 905+1Perubahan bintang dalam 7 hari terakhir
- #221
Pustaka PyTorch untuk segala hal tentang Reinforcement Learning (RL) untuk Combinatorial Optimization (CO)
★ 900+1Perubahan bintang dalam 7 hari terakhir - #222
Transformers adalah World Model yang Efisien-Sampel. ICLR 2023, 5% teratas yang luar biasa.
★ 900+0Perubahan bintang dalam 7 hari terakhir - #223
Daftar pilihan sumber daya Deep Reinforcement Learning yang luar biasa.
★ 900+1Perubahan bintang dalam 7 hari terakhir - #224
Tien Kung-Lab: Alur Kerja Langsung IsaacLab untuk Robot Berkaki
★ 883+10Perubahan bintang dalam 7 hari terakhir - #225
🕹️ Rangkaian lingkungan pembelajaran penguatan (reinforcement learning) yang dapat diskalakan di JAX
★ 861+2Perubahan bintang dalam 7 hari terakhir - #226
Alat desain molekuler AI untuk desain de novo, scaffold hopping, penggantian gugus R, desain linker, dan optimasi molekul.
★ 853+3Perubahan bintang dalam 7 hari terakhir - #227★ 850+0Perubahan bintang dalam 7 hari terakhir
- #228★ 848+3Perubahan bintang dalam 7 hari terakhir
- #229★ 841+0Perubahan bintang dalam 7 hari terakhir
- #230
🌟 Koleksi pilihan alat AI gratis berkualitas tinggi 🤖, API 🔗, dataset 📊, dan sumber belajar 📚 yang mencakup machine learning 🧠, deep learning 🧩, generative AI 🎨, NLP 💬, dan data science 📈. Dirancang untuk membantu pengembang 👩💻, peneliti 🔬, dan kreator ✨ menjelajahi dan membangun dengan AI lebih cepat ⚡.
★ 840+25Perubahan bintang dalam 7 hari terakhir - #231
Implementasi Python untuk algoritma contextual bandits
★ 838-1Perubahan bintang dalam 7 hari terakhir - #232
🚀🚀🚀Kumpulan beberapa proyek publik hebat tentang Large Language Model (LLM), Vision Language Model (VLM), Vision Language Action (VLA), AI Generated Content (AIGC), serta Dataset dan Aplikasi terkait.
★ 815+1Perubahan bintang dalam 7 hari terakhir - #233
Repositori untuk baseline pembelajaran penguatan (reinforcement learning) yang aman.
★ 813+0Perubahan bintang dalam 7 hari terakhir - #234
Daftar kurasi kerangka kerja, makalah, perangkat lunak, dan sumber daya NVIDIA Isaac Gym yang luar biasa
★ 797+1Perubahan bintang dalam 7 hari terakhir - #235
Koleksi makalah, laporan teknis, framework, and alat pilihan untuk on-policy distillation (OPD) pada model bahasa besar
★ 791+26Perubahan bintang dalam 7 hari terakhir - #236
MobileGym: Platform Simulasi yang Dapat Verifikasi dan Sangat Pararel untuk Penelitian Agen GUI Seluler · Simulator Android yang berjalan di browser · Simulator Android Berbasis Browser · Evaluasi yang Dapat Verifikasi · Pelatihan RL Online yang Dapat Skala
★ 786+9Perubahan bintang dalam 7 hari terakhir - #237
BFM_Zero: Model Fondasi Perilaku yang Dapat Diberi Prompt untuk Kontrol Humanoid Menggunakan Pembelajaran Penguatan Tanpa Pengawasan
★ 776+14Perubahan bintang dalam 7 hari terakhir - #238
MDP dan POMDP di Julia - Antarmuka untuk mendefinisikan, menyelesaikan, dan mensimulasikan proses keputusan Markov yang dapat diamati sepenuhnya dan sebagian pada ruang diskrit dan kontinu.
★ 766+1Perubahan bintang dalam 7 hari terakhir - #239★ 765+1Perubahan bintang dalam 7 hari terakhir
- #240
Lingkungan Gymnasium multi-tujuan untuk pembelajaran penguatan (reinforcement learning)
★ 760-1Perubahan bintang dalam 7 hari terakhir