Pular para o conteúdo principal
buildradar
Sign in
Tópico · reinforcement-learning

reinforcement-learning

Repositórios de código aberto acompanhados marcados com reinforcement-learning, ordenados por estrelas.

305 repositórios
  • vowpal_wabbit@VowpalWabbit

    Vowpal Wabbit é um sistema de aprendizado de máquina que expande as fronteiras da área com técnicas como online, hashing, allreduce, reductions, learning2search, active e interactive learning.

    8.708+2Variação de estrelas nos últimos 7 dias
  • pysc2@google-deepmind

    Ambiente de aprendizado para StarCraft II.

    8.309+2Variação de estrelas nos últimos 7 dias
  • PaLM-rlhf-pytorch@lucidrains

    Implementação de RLHF (Aprendizado por Reforço com Feedback Humano) sobre a arquitetura PaLM. Basicamente o ChatGPT, mas com PaLM.

    7.866-1Variação de estrelas nos últimos 7 dias
  • maths-cs-ai-compendium@HenryNdubuaku

    Torne-se um pesquisador ou engenheiro de IA/ML de alto nível com este livro didático não convencional que cobre matemática, computação e ML com intuição.

    7.400+21Variação de estrelas nos últimos 7 dias
  • Lista de leitura para tópicos de pesquisa em aprendizado de máquina multimodal

    6.926+1Variação de estrelas nos últimos 7 dias
  • Uma coleção de artigos, blogs e projetos sobre LLM, com foco no OpenAI o1 🍓 e técnicas de raciocínio.

    6.902+3Variação de estrelas nos últimos 7 dias
  • Practical_RL@yandexdataschool

    Um curso sobre aprendizado por reforço em cenários reais.

    6.566+0Variação de estrelas nos últimos 7 dias
  • 🔬 Uma lista curada de LLMs incríveis e estratégias e ferramentas de aprendizado profundo no mercado financeiro.

    6.475+23Variação de estrelas nos últimos 7 dias
  • Mooncake@kvcache-ai

    Mooncake é a plataforma de serviço para o Kimi, um serviço de LLM líder fornecido pela Moonshot AI.

    6.470+40Variação de estrelas nos últimos 7 dias
  • Uma lista curada de métodos de autoaprendizagem (self-supervised) incríveis

    6.414+1Variação de estrelas nos últimos 7 dias
  • PufferLib@PufferAI

    Impulsionando o aprendizado por reforço

    6.321+8Variação de estrelas nos últimos 7 dias
  • VLM-R1@om-ai-lab

    Resolver compreensão visual com VLMs reforçados.

    6.018+4Variação de estrelas nos últimos 7 dias
  • rllm@rllm-org

    Democratizando o Aprendizado por Reforço para LLMs.

    5.813+5Variação de estrelas nos últimos 7 dias
  • AReaL@areal-project

    A ponte de RL para aplicações de agentes baseadas em LLM. Simples e flexível.

    5.712+9Variação de estrelas nos últimos 7 dias
  • open_spiel@google-deepmind

    OpenSpiel é uma coleção de ambientes e algoritmos para pesquisa em aprendizado por reforço geral e busca/planejamento em jogos.

    5.452+8Variação de estrelas nos últimos 7 dias
  • Uma estrutura de robô quadrúpede de código aberto para desenvolver robôs de quatro patas no estilo Boston Dynamics, perfeitos para STEM, programação e educação em robótica, aplicações de robótica IoT, serviços de aplicação de robótica aprimorados por IA, pesquisa e desenvolvimento de kits de robótica DIY.

    5.246+15Variação de estrelas nos últimos 7 dias
  • xtuner@InternLM

    Um motor de treinamento de próxima geração construído para modelos MoE ultra-grandes

    5.188+3Variação de estrelas nos últimos 7 dias
  • deep-reinforcement-learning@udacity

    Repositório para o programa Nanodegree de Aprendizado por Reforço Profundo.

    5.176+0Variação de estrelas nos últimos 7 dias
  • EasyR1@hiyouga

    EasyR1: Um framework de treinamento de RL multimodal eficiente, escalável e baseado no veRL

    5.141+5Variação de estrelas nos últimos 7 dias
  • reasoning-from-scratch@rasbt

    Implemente um LLM de raciocínio em PyTorch do zero, passo a passo

    5.138+49Variação de estrelas nos últimos 7 dias
  • deep-rl-class@huggingface

    Este repositório contém o curso de Aprendizado por Reforço Profundo da Hugging Face.

    5.006+10Variação de estrelas nos últimos 7 dias
  • LLM-RL-Visualized@changyeyu

    🌟100+ Mapas conceituais originais de LLM / RL 📚, contribuição do autor de "Algoritmos de Grandes Modelos"!💥 (100+ Mapas de Algoritmos LLM/RL)

    4.838+12Variação de estrelas nos últimos 7 dias
  • trlx@CarperAI

    Um repositório para treinamento distribuído de modelos de linguagem com Aprendizado por Reforço via Feedback Humano (RLHF).

    4.754-1Variação de estrelas nos últimos 7 dias
  • RLinf@RLinf

    RLinf: Infraestrutura de Aprendizado por Reforço para IA incorporada e agentica.

    4.705+31Variação de estrelas nos últimos 7 dias
  • dm_control@google-deepmind

    Stack de software do Google DeepMind para simulação baseada em física e ambientes de Aprendizado por Reforço, utilizando MuJoCo

    4.681+6Variação de estrelas nos últimos 7 dias
  • DouZero@kwai

    [ICML 2021] DouZero: Dominando o DouDizhu com Aprendizado por Reforço Profundo via Self-Play | IA para DouDizhu

    4.659+5Variação de estrelas nos últimos 7 dias
  • alpha-zero-general@suragnair

    Uma implementação limpa baseada em AlphaZero para qualquer jogo em qualquer framework + tutorial + Othello/Gobang/TicTacToe/Connect4 e mais.

    4.512+5Variação de estrelas nos últimos 7 dias
  • awesome-RLHF@opendilab

    Uma lista curada de recursos sobre aprendizado por reforço com feedback humano (atualizada continuamente).

    4.424+2Variação de estrelas nos últimos 7 dias
  • ElegantRL@AI4Finance-Foundation

    Aprendizado por reforço profundo massivamente paralelo.

    4.359+2Variação de estrelas nos últimos 7 dias
  • hands-on-modern-rl@walkinglabs

    Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.

    4.199+54Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos