Zum Hauptinhalt springen
buildradar
Sign in
Thema · reinforcement-learning

reinforcement-learning

Erfasste Open-Source-Repos mit dem Tag reinforcement-learning, sortiert nach Sternen.

304 Repos
  • vowpal_wabbit@VowpalWabbit

    Vowpal Wabbit ist ein System für maschinelles Lernen, das die Grenzen des maschinellen Lernens mit Techniken wie Online-, Hashing-, Allreduce-, Reduktions-, Learning2search-, aktivem und interaktivem Lernen erweitert.

    8.708+2Sterne-Änderung der letzten 7 Tage
  • pysc2@google-deepmind

    StarCraft II Lernumgebung

    8.309+2Sterne-Änderung der letzten 7 Tage
  • PaLM-rlhf-pytorch@lucidrains

    Implementierung von RLHF (Reinforcement Learning with Human Feedback) auf Basis der PaLM-Architektur. Im Grunde wie ChatGPT, nur mit PaLM

    7.866-2Sterne-Änderung der letzten 7 Tage
  • maths-cs-ai-compendium@HenryNdubuaku

    Werde zu einem herausragenden KI/ML-Forscher bzw. -Ingenieur mit diesem unkonventionellen Lehrbuch, das Mathematik, Computing und ML mit Intuition vermittelt.

    7.400+28Sterne-Änderung der letzten 7 Tage
  • Leseliste für Forschungsthemen im Bereich multimodales maschinelles Lernen.

    6.926+0Sterne-Änderung der letzten 7 Tage
  • Eine Sammlung von LLM-Papern, -Blogs und -Projekten mit Schwerpunkt auf OpenAI o1 🍓 und Reasoning-Techniken.

    6.902+3Sterne-Änderung der letzten 7 Tage
  • Practical_RL@yandexdataschool

    Ein Kurs zum Thema Reinforcement Learning in der Praxis

    6.566+2Sterne-Änderung der letzten 7 Tage
  • 🔬 Eine kuratierte Liste fantastischer LLMs, Deep-Learning-Strategien und Tools im Finanzmarkt.

    6.475+31Sterne-Änderung der letzten 7 Tage
  • Mooncake@kvcache-ai

    Mooncake ist die Serving-Plattform für Kimi, einen führenden LLM-Dienst von Moonshot AI.

    6.470+70Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste fantastischer Self-Supervised-Methoden

    6.414+1Sterne-Änderung der letzten 7 Tage
  • PufferLib@PufferAI

    Verstärkung für Reinforcement Learning

    6.321+15Sterne-Änderung der letzten 7 Tage
  • VLM-R1@om-ai-lab

    Visuelles Verstehen mit RL-basierten VLMs lösen

    6.018+3Sterne-Änderung der letzten 7 Tage
  • rllm@rllm-org

    Demokratisierung von Reinforcement Learning für LLMs

    5.813+9Sterne-Änderung der letzten 7 Tage
  • AReaL@areal-project

    Die RL-Brücke für LLM-basierte Agentenanwendungen. Einfach und flexibel gestaltet.

    5.712+16Sterne-Änderung der letzten 7 Tage
  • open_spiel@google-deepmind

    OpenSpiel ist eine Sammlung von Umgebungen und Algorithmen für die Forschung im Bereich des allgemeinen Reinforcement Learning sowie Suche und Planung in Spielen.

    5.452+15Sterne-Änderung der letzten 7 Tage
  • Ein Open-Source-Framework für vierbeinige Roboter-Haustiere zur Entwicklung von vierbeinigen Robotern im Boston-Dynamics-Stil, ideal für STEM-, Programmier- und Robotik-Ausbildung, IoT-Robotikanwendungen, KI-erweiterte Robotikanwendungsdienste, Forschung und die Entwicklung von DIY-Robotik-Kits.

    5.246+26Sterne-Änderung der letzten 7 Tage
  • xtuner@InternLM

    Eine Trainings-Engine der nächsten Generation für extrem große MoE-Modelle

    5.188+5Sterne-Änderung der letzten 7 Tage
  • deep-reinforcement-learning@udacity

    Repository für das Deep Reinforcement Learning Nanodegree-Programm

    5.176+0Sterne-Änderung der letzten 7 Tage
  • EasyR1@hiyouga

    EasyR1: Ein effizientes, skalierbares, multimodales RL-Trainingsframework basierend auf veRL

    5.141+11Sterne-Änderung der letzten 7 Tage
  • reasoning-from-scratch@rasbt

    Implementierung eines begründenden LLM in PyTorch von Grund auf, Schritt für Schritt

    5.138+67Sterne-Änderung der letzten 7 Tage
  • deep-rl-class@huggingface

    Dieses Repository enthält den Deep Reinforcement Learning Course von Hugging Face.

    5.006+10Sterne-Änderung der letzten 7 Tage
  • LLM-RL-Visualized@changyeyu

    🌟 Über 100 originale LLM- und RL-Prinzipschemata 📚, präsentiert vom Autor von „Large Model Algorithms“! 💥

    4.838+16Sterne-Änderung der letzten 7 Tage
  • trlx@CarperAI

    Ein Repository für das verteilte Training von Sprachmodellen mit Reinforcement Learning via Human Feedback (RLHF)

    4.754-1Sterne-Änderung der letzten 7 Tage
  • RLinf@RLinf

    RLinf: Reinforcement-Learning-Infrastruktur für Embodied und Agentic AI

    4.705+44Sterne-Änderung der letzten 7 Tage
  • dm_control@google-deepmind

    Die Software-Plattform von Google DeepMind für physikbasierte Simulationen und Reinforcement-Learning-Umgebungen unter Verwendung von MuJoCo.

    4.681+9Sterne-Änderung der letzten 7 Tage
  • DouZero@kwai

    [ICML 2021] DouZero: Beherrschung von DouDizhu durch Self-Play Deep Reinforcement Learning | 斗地主AI

    4.659+7Sterne-Änderung der letzten 7 Tage
  • alpha-zero-general@suragnair

    Eine saubere Implementierung basierend auf AlphaZero für jedes Spiel in jedem Framework + Tutorial + Othello/Gobang/TicTacToe/Connect4 und mehr

    4.512+6Sterne-Änderung der letzten 7 Tage
  • awesome-RLHF@opendilab

    Eine kuratierte Liste von Ressourcen zu Reinforcement Learning from Human Feedback (kontinuierlich aktualisiert)

    4.424+2Sterne-Änderung der letzten 7 Tage
  • ElegantRL@AI4Finance-Foundation

    Massiv paralleles Deep Reinforcement Learning. 🔥

    4.359+4Sterne-Änderung der letzten 7 Tage
  • hands-on-modern-rl@walkinglabs

    🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.

    4.199+69Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen