reinforcement-learning
Erfasste Open-Source-Repos mit dem Tag reinforcement-learning, sortiert nach Sternen.
- #31
Vowpal Wabbit ist ein System für maschinelles Lernen, das die Grenzen des maschinellen Lernens mit Techniken wie Online-, Hashing-, Allreduce-, Reduktions-, Learning2search-, aktivem und interaktivem Lernen erweitert.
★ 8.708+2Sterne-Änderung der letzten 7 Tage - #32★ 8.309+2Sterne-Änderung der letzten 7 Tage
- #33
Implementierung von RLHF (Reinforcement Learning with Human Feedback) auf Basis der PaLM-Architektur. Im Grunde wie ChatGPT, nur mit PaLM
★ 7.866-2Sterne-Änderung der letzten 7 Tage - #34
Werde zu einem herausragenden KI/ML-Forscher bzw. -Ingenieur mit diesem unkonventionellen Lehrbuch, das Mathematik, Computing und ML mit Intuition vermittelt.
★ 7.400+28Sterne-Änderung der letzten 7 Tage - #35
Leseliste für Forschungsthemen im Bereich multimodales maschinelles Lernen.
★ 6.926+0Sterne-Änderung der letzten 7 Tage - #36
Eine Sammlung von LLM-Papern, -Blogs und -Projekten mit Schwerpunkt auf OpenAI o1 🍓 und Reasoning-Techniken.
★ 6.902+3Sterne-Änderung der letzten 7 Tage - #37
Ein Kurs zum Thema Reinforcement Learning in der Praxis
★ 6.566+2Sterne-Änderung der letzten 7 Tage - #38
🔬 Eine kuratierte Liste fantastischer LLMs, Deep-Learning-Strategien und Tools im Finanzmarkt.
★ 6.475+31Sterne-Änderung der letzten 7 Tage - #39
Mooncake ist die Serving-Plattform für Kimi, einen führenden LLM-Dienst von Moonshot AI.
★ 6.470+70Sterne-Änderung der letzten 7 Tage - #40
Eine kuratierte Liste fantastischer Self-Supervised-Methoden
★ 6.414+1Sterne-Änderung der letzten 7 Tage - #41★ 6.321+15Sterne-Änderung der letzten 7 Tage
- #42★ 6.018+3Sterne-Änderung der letzten 7 Tage
- #43★ 5.813+9Sterne-Änderung der letzten 7 Tage
- #44
Die RL-Brücke für LLM-basierte Agentenanwendungen. Einfach und flexibel gestaltet.
★ 5.712+16Sterne-Änderung der letzten 7 Tage - #45
OpenSpiel ist eine Sammlung von Umgebungen und Algorithmen für die Forschung im Bereich des allgemeinen Reinforcement Learning sowie Suche und Planung in Spielen.
★ 5.452+15Sterne-Änderung der letzten 7 Tage - #46
Ein Open-Source-Framework für vierbeinige Roboter-Haustiere zur Entwicklung von vierbeinigen Robotern im Boston-Dynamics-Stil, ideal für STEM-, Programmier- und Robotik-Ausbildung, IoT-Robotikanwendungen, KI-erweiterte Robotikanwendungsdienste, Forschung und die Entwicklung von DIY-Robotik-Kits.
★ 5.246+26Sterne-Änderung der letzten 7 Tage - #47★ 5.188+5Sterne-Änderung der letzten 7 Tage
- #48
Repository für das Deep Reinforcement Learning Nanodegree-Programm
★ 5.176+0Sterne-Änderung der letzten 7 Tage - #49
EasyR1: Ein effizientes, skalierbares, multimodales RL-Trainingsframework basierend auf veRL
★ 5.141+11Sterne-Änderung der letzten 7 Tage - #50
Implementierung eines begründenden LLM in PyTorch von Grund auf, Schritt für Schritt
★ 5.138+67Sterne-Änderung der letzten 7 Tage - #51
Dieses Repository enthält den Deep Reinforcement Learning Course von Hugging Face.
★ 5.006+10Sterne-Änderung der letzten 7 Tage - #52
🌟 Über 100 originale LLM- und RL-Prinzipschemata 📚, präsentiert vom Autor von „Large Model Algorithms“! 💥
★ 4.838+16Sterne-Änderung der letzten 7 Tage - #53
Ein Repository für das verteilte Training von Sprachmodellen mit Reinforcement Learning via Human Feedback (RLHF)
★ 4.754-1Sterne-Änderung der letzten 7 Tage - #54★ 4.705+44Sterne-Änderung der letzten 7 Tage
- #55
Die Software-Plattform von Google DeepMind für physikbasierte Simulationen und Reinforcement-Learning-Umgebungen unter Verwendung von MuJoCo.
★ 4.681+9Sterne-Änderung der letzten 7 Tage - #56
[ICML 2021] DouZero: Beherrschung von DouDizhu durch Self-Play Deep Reinforcement Learning | 斗地主AI
★ 4.659+7Sterne-Änderung der letzten 7 Tage - #57
Eine saubere Implementierung basierend auf AlphaZero für jedes Spiel in jedem Framework + Tutorial + Othello/Gobang/TicTacToe/Connect4 und mehr
★ 4.512+6Sterne-Änderung der letzten 7 Tage - #58
Eine kuratierte Liste von Ressourcen zu Reinforcement Learning from Human Feedback (kontinuierlich aktualisiert)
★ 4.424+2Sterne-Änderung der letzten 7 Tage - #59★ 4.359+4Sterne-Änderung der letzten 7 Tage
- #60
🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.
★ 4.199+69Sterne-Änderung der letzten 7 Tage