reinforcement-learning
Repositórios de código aberto acompanhados marcados com reinforcement-learning, ordenados por estrelas.
- #271★ 638+1Variação de estrelas nos últimos 7 dias
- #272
Este repositório coleta alguns códigos que encapsulam algoritmos comumente usados no campo de aprendizado de máquina (machine learning). A maioria deles é baseada em Numpy, Pandas ou Torch. Você pode aprofundar sua compreensão sobre modelos e algoritmos relacionados ou modificá-los para obter seu próprio código personalizado consultando este repositório.
★ 635+0Variação de estrelas nos últimos 7 dias - #273
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source para LLMs e Cenários de Agentes
★ 634+9Variação de estrelas nos últimos 7 dias - #274★ 633+0Variação de estrelas nos últimos 7 dias
- #275
API para executar o VirtualHome, um simulador doméstico multiagente.
★ 632+2Variação de estrelas nos últimos 7 dias - #276★ 631+0Variação de estrelas nos últimos 7 dias
- #277
Implantar o projeto walk-these-ways no Unitree Go2
★ 623+3Variação de estrelas nos últimos 7 dias - #278
Explore o "Momento Aha" Multimodal em um modelo de 2B
★ 623+0Variação de estrelas nos últimos 7 dias - #279
Publicado na Nature Machine Intelligence! O primeiro robô real (quadricóptero) baseado em treinamento de física diferenciável.
★ 614+9Variação de estrelas nos últimos 7 dias - #280
Anotações do curso "Machine Learning 2021 Spring" do Professor Hung-yi Lee da Universidade Nacional de Taiwan (NTU)
★ 603+3Variação de estrelas nos últimos 7 dias - #281
[ICLR 2026] ReCogDrive: Uma estrutura cognitiva reforçada para condução autônoma de ponta a ponta
★ 599+4Variação de estrelas nos últimos 7 dias - #282
Artigos relacionados para aprendizado por reforço, incluindo artigos clássicos e os mais recentes nas principais conferências
★ 595+0Variação de estrelas nos últimos 7 dias - #283
Um Motor de Aprendizado por Reforço Assíncrono para Pós-Treinamento Omni-Modal em Escala
★ 592+11Variação de estrelas nos últimos 7 dias - #284
Uma lista selecionada de artigos sobre aprendizado por reforço para geração de vídeo
★ 591+1Variação de estrelas nos últimos 7 dias - #285
[ICML 2026] Recursos oficiais de "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning".
★ 591+1Variação de estrelas nos últimos 7 dias - #286
Artigos da AAAI 2024: Explore uma coleção abrangente de artigos de pesquisa inovadores apresentados em uma das principais conferências de inteligência artificial. Integre perfeitamente implementações de código para uma melhor compreensão. ⭐ Experimente a vanguarda do progresso em inteligência artificial com este repositório!
★ 591+1Variação de estrelas nos últimos 7 dias - #287★ 586+0Variação de estrelas nos últimos 7 dias
- #288
NeurIPS 2023: Safety-Gymnasium: Um Benchmark Unificado de Aprendizado por Reforço Seguro
★ 580+1Variação de estrelas nos últimos 7 dias - #289★ 578+3Variação de estrelas nos últimos 7 dias
- #290
Implementação de ChatGPT RLHF (Aprendizado por Reforço com Feedback Humano) em qualquer modelo de geração no transformers da huggingface (bloomz-176B/bloom/gpt/bart/T5/MetaICL)
★ 564+0Variação de estrelas nos últimos 7 dias - #291
Aprendizado por Reforço Profundo (PPO) em Condução Autônoma (Carla) [do zero]
★ 563-1Variação de estrelas nos últimos 7 dias - #292
Meta Agents Research Environments é uma plataforma abrangente projetada para avaliar agentes de IA em cenários dinâmicos e realistas. Ao contrário de benchmarks estáticos, esta plataforma introduz ambientes em evolução onde os agentes devem adaptar suas estratégias à medida que novas informações se tornam disponíveis, espelhando os desafios do mundo real.
★ 551+3Variação de estrelas nos últimos 7 dias - #293
Uma lista curada de recursos de inteligência artificial (Cursos, Ferramentas, Aplicativos, Projetos de Código Aberto)
★ 548-1Variação de estrelas nos últimos 7 dias - #294
[Destaque do NeurIPS 2025] Suite de pós-treinamento de LLM — apresentando ReasonFlux, ReasonFlux-PRM e ReasonFlux-Coder.
★ 542+0Variação de estrelas nos últimos 7 dias - #295★ 539+2Variação de estrelas nos últimos 7 dias
- #296
UMI on Legs: Tornando políticas de manipulação móveis com controladores de corpo inteiro centrados em manipulação
★ 536+3Variação de estrelas nos últimos 7 dias - #297
Lista com curadoria de cursos de engenharia de machine learning publicamente acessíveis da CalTech, Columbia, Berkeley, MIT e Stanford.
★ 535+1Variação de estrelas nos últimos 7 dias - #298
Implementações de algoritmos de Aprendizado por Reforço Multi-Objetivo.
★ 533+1Variação de estrelas nos últimos 7 dias - #299
[CVPR 2025 Highlight] InterMimic: rumo ao controle universal de corpo inteiro para interações humano-objeto baseadas em física
★ 528+1Variação de estrelas nos últimos 7 dias - #300
Um simulador flexível, de uso geral e fácil de usar, junto com um ambiente de negociação OpenAI Gym para a plataforma de negociação MetaTrader 5 (Aprovado pelo OpenAI Gym)
★ 524+0Variação de estrelas nos últimos 7 dias