reinforcement-learning
Repositorios de código abierto monitorizados etiquetados con reinforcement-learning, ordenados por estrellas.
- #31
Vowpal Wabbit es un sistema de machine learning que impulsa la frontera del machine learning con técnicas como aprendizaje en línea, hashing, allreduce, reducciones, learning2search, activo e interactivo.
★ 8708+2Variación de estrellas de los últimos 7 días - #32★ 8309+2Variación de estrellas de los últimos 7 días
- #33
Implementación de RLHF (aprendizaje por refuerzo con retroalimentación humana) sobre la arquitectura PaLM. Básicamente ChatGPT pero con PaLM
★ 7866-1Variación de estrellas de los últimos 7 días - #34
Conviértete en un investigador/ingeniero experto en IA/ML con este libro de texto no convencional que abarca matemáticas, computación y ML con intuición.
★ 7400+21Variación de estrellas de los últimos 7 días - #35
Lista de lectura para temas de investigación en aprendizaje automático multimodal
★ 6926+1Variación de estrellas de los últimos 7 días - #36
Una colección de artículos, blogs y proyectos sobre LLM, con enfoque en OpenAI o1 🍓 y técnicas de razonamiento.
★ 6902+3Variación de estrellas de los últimos 7 días - #37
Un curso de aprendizaje por refuerzo en el mundo real
★ 6566+0Variación de estrellas de los últimos 7 días - #38
🔬 Una lista seleccionada de excelentes LLMs, estrategias de deep learning y herramientas para el mercado financiero.
★ 6475+23Variación de estrellas de los últimos 7 días - #39
Mooncake es la plataforma de servicio para Kimi, un servicio de LLM líder proporcionado por Moonshot AI.
★ 6470+40Variación de estrellas de los últimos 7 días - #40
Una lista seleccionada de excelentes métodos de aprendizaje auto־supervisado
★ 6414+1Variación de estrellas de los últimos 7 días - #41★ 6321+8Variación de estrellas de los últimos 7 días
- #42★ 6018+4Variación de estrellas de los últimos 7 días
- #43★ 5813+5Variación de estrellas de los últimos 7 días
- #44★ 5712+9Variación de estrellas de los últimos 7 días
- #45
OpenSpiel es una colección de entornos y algoritmos para la investigación en aprendizaje por refuerzo general y búsqueda/planificación en juegos.
★ 5452+8Variación de estrellas de los últimos 7 días - #46
Un marco de código abierto para robots cuadrúpedos, diseñado para desarrollar robots de cuatro patas al estilo de Boston Dynamics, ideal para educación en STEM, programación y robótica, aplicaciones de robótica IoT, servicios de aplicaciones de robótica mejorados con IA, investigación y desarrollo de kits de robótica DIY.
★ 5246+15Variación de estrellas de los últimos 7 días - #47
Un motor de entrenamiento de próxima generación diseñado para modelos MoE ultra grandes
★ 5188+3Variación de estrellas de los últimos 7 días - #48
Repositorio para el programa Nanodegree de Aprendizaje por Refuerzo Profundo (Deep Reinforcement Learning)
★ 5176+0Variación de estrellas de los últimos 7 días - #49
EasyR1: Un framework de entrenamiento de RL multimodal, eficiente y escalable basado en veRL
★ 5141+5Variación de estrellas de los últimos 7 días - #50
Implementa un LLM de razonamiento en PyTorch desde cero, paso a paso
★ 5138+49Variación de estrellas de los últimos 7 días - #51
Este repositorio contiene el curso de Aprendizaje por Refuerzo Profundo de Hugging Face.
★ 5006+10Variación de estrellas de los últimos 7 días - #52
🌟 ¡Más de 100 mapas de algoritmos de LLM / RL originales 📚, una gran obra del autor de "Algoritmos de Grandes Modelos"! 💥 (100+ LLM/RL Algorithm Maps)
★ 4838+12Variación de estrellas de los últimos 7 días - #53
Un repositorio para el entrenamiento distribuido de modelos de lenguaje con aprendizaje por refuerzo a partir de retroalimentación humana (RLHF)
★ 4754-1Variación de estrellas de los últimos 7 días - #54★ 4705+31Variación de estrellas de los últimos 7 días
- #55
Pila de software de Google DeepMind para simulación basada en física y entornos de Aprendizaje por Refuerzo, utilizando MuJoCo.
★ 4681+6Variación de estrellas de los últimos 7 días - #56
[ICML 2021] DouZero: Dominando DouDizhu con aprendizaje por refuerzo profundo y auto-juego | IA de DouDizhu
★ 4659+5Variación de estrellas de los últimos 7 días - #57
Una implementación limpia basada en AlphaZero para cualquier juego en cualquier framework + tutorial + Othello/Gobang/TicTacToe/Connect4 y más
★ 4512+5Variación de estrellas de los últimos 7 días - #58
Una lista seleccionada de recursos sobre aprendizaje por refuerzo con retroalimentación humana (actualizada continuamente)
★ 4424+2Variación de estrellas de los últimos 7 días - #59★ 4359+2Variación de estrellas de los últimos 7 días
- #60
🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.
★ 4199+54Variación de estrellas de los últimos 7 días