Saltar al contenido principal
buildradar
Sign in
Tema · reinforcement-learning

reinforcement-learning

Repositorios de código abierto monitorizados etiquetados con reinforcement-learning, ordenados por estrellas.

305 repositorios
  • vowpal_wabbit@VowpalWabbit

    Vowpal Wabbit es un sistema de machine learning que impulsa la frontera del machine learning con técnicas como aprendizaje en línea, hashing, allreduce, reducciones, learning2search, activo e interactivo.

    8708+2Variación de estrellas de los últimos 7 días
  • pysc2@google-deepmind

    Entorno de aprendizaje de StarCraft II.

    8309+2Variación de estrellas de los últimos 7 días
  • PaLM-rlhf-pytorch@lucidrains

    Implementación de RLHF (aprendizaje por refuerzo con retroalimentación humana) sobre la arquitectura PaLM. Básicamente ChatGPT pero con PaLM

    7866-1Variación de estrellas de los últimos 7 días
  • maths-cs-ai-compendium@HenryNdubuaku

    Conviértete en un investigador/ingeniero experto en IA/ML con este libro de texto no convencional que abarca matemáticas, computación y ML con intuición.

    7400+21Variación de estrellas de los últimos 7 días
  • Lista de lectura para temas de investigación en aprendizaje automático multimodal

    6926+1Variación de estrellas de los últimos 7 días
  • Una colección de artículos, blogs y proyectos sobre LLM, con enfoque en OpenAI o1 🍓 y técnicas de razonamiento.

    6902+3Variación de estrellas de los últimos 7 días
  • Practical_RL@yandexdataschool

    Un curso de aprendizaje por refuerzo en el mundo real

    6566+0Variación de estrellas de los últimos 7 días
  • 🔬 Una lista seleccionada de excelentes LLMs, estrategias de deep learning y herramientas para el mercado financiero.

    6475+23Variación de estrellas de los últimos 7 días
  • Mooncake@kvcache-ai

    Mooncake es la plataforma de servicio para Kimi, un servicio de LLM líder proporcionado por Moonshot AI.

    6470+40Variación de estrellas de los últimos 7 días
  • Una lista seleccionada de excelentes métodos de aprendizaje auto־supervisado

    6414+1Variación de estrellas de los últimos 7 días
  • PufferLib@PufferAI

    Potenciando el aprendizaje por refuerzo

    6321+8Variación de estrellas de los últimos 7 días
  • VLM-R1@om-ai-lab

    Resuelve la comprensión visual con VLMs reforzados

    6018+4Variación de estrellas de los últimos 7 días
  • rllm@rllm-org

    Democratizando el aprendizaje por refuerzo para LLMs

    5813+5Variación de estrellas de los últimos 7 días
  • AReaL@areal-project

    El puente de RL para aplicaciones de agentes basados en LLM. Simple y flexible.

    5712+9Variación de estrellas de los últimos 7 días
  • open_spiel@google-deepmind

    OpenSpiel es una colección de entornos y algoritmos para la investigación en aprendizaje por refuerzo general y búsqueda/planificación en juegos.

    5452+8Variación de estrellas de los últimos 7 días
  • Un marco de código abierto para robots cuadrúpedos, diseñado para desarrollar robots de cuatro patas al estilo de Boston Dynamics, ideal para educación en STEM, programación y robótica, aplicaciones de robótica IoT, servicios de aplicaciones de robótica mejorados con IA, investigación y desarrollo de kits de robótica DIY.

    5246+15Variación de estrellas de los últimos 7 días
  • xtuner@InternLM

    Un motor de entrenamiento de próxima generación diseñado para modelos MoE ultra grandes

    5188+3Variación de estrellas de los últimos 7 días
  • deep-reinforcement-learning@udacity

    Repositorio para el programa Nanodegree de Aprendizaje por Refuerzo Profundo (Deep Reinforcement Learning)

    5176+0Variación de estrellas de los últimos 7 días
  • EasyR1@hiyouga

    EasyR1: Un framework de entrenamiento de RL multimodal, eficiente y escalable basado en veRL

    5141+5Variación de estrellas de los últimos 7 días
  • reasoning-from-scratch@rasbt

    Implementa un LLM de razonamiento en PyTorch desde cero, paso a paso

    5138+49Variación de estrellas de los últimos 7 días
  • deep-rl-class@huggingface

    Este repositorio contiene el curso de Aprendizaje por Refuerzo Profundo de Hugging Face.

    5006+10Variación de estrellas de los últimos 7 días
  • LLM-RL-Visualized@changyeyu

    🌟 ¡Más de 100 mapas de algoritmos de LLM / RL originales 📚, una gran obra del autor de "Algoritmos de Grandes Modelos"! 💥 (100+ LLM/RL Algorithm Maps)

    4838+12Variación de estrellas de los últimos 7 días
  • trlx@CarperAI

    Un repositorio para el entrenamiento distribuido de modelos de lenguaje con aprendizaje por refuerzo a partir de retroalimentación humana (RLHF)

    4754-1Variación de estrellas de los últimos 7 días
  • RLinf@RLinf

    RLinf: Infraestructura de aprendizaje por refuerzo para IA encarnada y agéntica

    4705+31Variación de estrellas de los últimos 7 días
  • dm_control@google-deepmind

    Pila de software de Google DeepMind para simulación basada en física y entornos de Aprendizaje por Refuerzo, utilizando MuJoCo.

    4681+6Variación de estrellas de los últimos 7 días
  • DouZero@kwai

    [ICML 2021] DouZero: Dominando DouDizhu con aprendizaje por refuerzo profundo y auto-juego | IA de DouDizhu

    4659+5Variación de estrellas de los últimos 7 días
  • alpha-zero-general@suragnair

    Una implementación limpia basada en AlphaZero para cualquier juego en cualquier framework + tutorial + Othello/Gobang/TicTacToe/Connect4 y más

    4512+5Variación de estrellas de los últimos 7 días
  • awesome-RLHF@opendilab

    Una lista seleccionada de recursos sobre aprendizaje por refuerzo con retroalimentación humana (actualizada continuamente)

    4424+2Variación de estrellas de los últimos 7 días
  • ElegantRL@AI4Finance-Foundation

    Aprendizaje por refuerzo profundo masivamente paralelo. 🔥

    4359+2Variación de estrellas de los últimos 7 días
  • hands-on-modern-rl@walkinglabs

    🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.

    4199+54Variación de estrellas de los últimos 7 días
← Volver a temas