reinforcement-learning
Repositórios de código aberto acompanhados marcados com reinforcement-learning, ordenados por estrelas.
- #31
Vowpal Wabbit é um sistema de aprendizado de máquina que expande as fronteiras da área com técnicas como online, hashing, allreduce, reductions, learning2search, active e interactive learning.
★ 8.708+2Variação de estrelas nos últimos 7 dias - #32★ 8.309+2Variação de estrelas nos últimos 7 dias
- #33
Implementação de RLHF (Aprendizado por Reforço com Feedback Humano) sobre a arquitetura PaLM. Basicamente o ChatGPT, mas com PaLM.
★ 7.866-1Variação de estrelas nos últimos 7 dias - #34
Torne-se um pesquisador ou engenheiro de IA/ML de alto nível com este livro didático não convencional que cobre matemática, computação e ML com intuição.
★ 7.400+21Variação de estrelas nos últimos 7 dias - #35
Lista de leitura para tópicos de pesquisa em aprendizado de máquina multimodal
★ 6.926+1Variação de estrelas nos últimos 7 dias - #36
Uma coleção de artigos, blogs e projetos sobre LLM, com foco no OpenAI o1 🍓 e técnicas de raciocínio.
★ 6.902+3Variação de estrelas nos últimos 7 dias - #37
Um curso sobre aprendizado por reforço em cenários reais.
★ 6.566+0Variação de estrelas nos últimos 7 dias - #38
🔬 Uma lista curada de LLMs incríveis e estratégias e ferramentas de aprendizado profundo no mercado financeiro.
★ 6.475+23Variação de estrelas nos últimos 7 dias - #39
Mooncake é a plataforma de serviço para o Kimi, um serviço de LLM líder fornecido pela Moonshot AI.
★ 6.470+40Variação de estrelas nos últimos 7 dias - #40
Uma lista curada de métodos de autoaprendizagem (self-supervised) incríveis
★ 6.414+1Variação de estrelas nos últimos 7 dias - #41★ 6.321+8Variação de estrelas nos últimos 7 dias
- #42★ 6.018+4Variação de estrelas nos últimos 7 dias
- #43★ 5.813+5Variação de estrelas nos últimos 7 dias
- #44★ 5.712+9Variação de estrelas nos últimos 7 dias
- #45
OpenSpiel é uma coleção de ambientes e algoritmos para pesquisa em aprendizado por reforço geral e busca/planejamento em jogos.
★ 5.452+8Variação de estrelas nos últimos 7 dias - #46
Uma estrutura de robô quadrúpede de código aberto para desenvolver robôs de quatro patas no estilo Boston Dynamics, perfeitos para STEM, programação e educação em robótica, aplicações de robótica IoT, serviços de aplicação de robótica aprimorados por IA, pesquisa e desenvolvimento de kits de robótica DIY.
★ 5.246+15Variação de estrelas nos últimos 7 dias - #47
Um motor de treinamento de próxima geração construído para modelos MoE ultra-grandes
★ 5.188+3Variação de estrelas nos últimos 7 dias - #48
Repositório para o programa Nanodegree de Aprendizado por Reforço Profundo.
★ 5.176+0Variação de estrelas nos últimos 7 dias - #49
EasyR1: Um framework de treinamento de RL multimodal eficiente, escalável e baseado no veRL
★ 5.141+5Variação de estrelas nos últimos 7 dias - #50
Implemente um LLM de raciocínio em PyTorch do zero, passo a passo
★ 5.138+49Variação de estrelas nos últimos 7 dias - #51
Este repositório contém o curso de Aprendizado por Reforço Profundo da Hugging Face.
★ 5.006+10Variação de estrelas nos últimos 7 dias - #52
🌟100+ Mapas conceituais originais de LLM / RL 📚, contribuição do autor de "Algoritmos de Grandes Modelos"!💥 (100+ Mapas de Algoritmos LLM/RL)
★ 4.838+12Variação de estrelas nos últimos 7 dias - #53
Um repositório para treinamento distribuído de modelos de linguagem com Aprendizado por Reforço via Feedback Humano (RLHF).
★ 4.754-1Variação de estrelas nos últimos 7 dias - #54★ 4.705+31Variação de estrelas nos últimos 7 dias
- #55
Stack de software do Google DeepMind para simulação baseada em física e ambientes de Aprendizado por Reforço, utilizando MuJoCo
★ 4.681+6Variação de estrelas nos últimos 7 dias - #56
[ICML 2021] DouZero: Dominando o DouDizhu com Aprendizado por Reforço Profundo via Self-Play | IA para DouDizhu
★ 4.659+5Variação de estrelas nos últimos 7 dias - #57
Uma implementação limpa baseada em AlphaZero para qualquer jogo em qualquer framework + tutorial + Othello/Gobang/TicTacToe/Connect4 e mais.
★ 4.512+5Variação de estrelas nos últimos 7 dias - #58
Uma lista curada de recursos sobre aprendizado por reforço com feedback humano (atualizada continuamente).
★ 4.424+2Variação de estrelas nos últimos 7 dias - #59★ 4.359+2Variação de estrelas nos últimos 7 dias
- #60
Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.
★ 4.199+54Variação de estrelas nos últimos 7 dias