grpo
Repositórios de código aberto acompanhados marcados com grpo, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de grpo no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com grpo.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Use PEFT ou Full-parameter para CPT/SFT/DPO/GRPO em mais de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) e mais de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.488+88Variação de estrelas nos últimos 7 dias - #2
Biblioteca de código aberto abrangente de habilidades de engenharia e pesquisa em IA para qualquer modelo. Empacote as habilidades e seu agente Claude Code/Codex/Gemini se tornará um agente de pesquisa em IA de alto desempenho. Mantido pela Orchestra Research.
★ 12.256+104Variação de estrelas nos últimos 7 dias - #3
Agent Reinforcement Trainer: treine agentes de múltiplas etapas para tarefas do mundo real usando GRPO. Dê aos seus agentes treinamento prático. Aprendizado por reforço para Qwen3.6, GPT-OSS, Llama e muito mais!
★ 10.689+10Variação de estrelas nos últimos 7 dias - #4
https://adongwanai.github.io/AgentGuide | Guia de desenvolvimento de agentes de IA | Prática de LangGraph | RAG avançado | Transição para LLMs | Entrevistas de LLM | Engenheiro de algoritmos | Banco de questões de entrevista | Aprendizado por reforço | Síntese de dados.
★ 9.116+169Variação de estrelas nos últimos 7 dias - #5★ 6.018+4Variação de estrelas nos últimos 7 dias
- #6
OpenClaw-RL: Treine qualquer agente simplesmente conversando
★ 5.665+7Variação de estrelas nos últimos 7 dias - #7
Implemente um LLM de raciocínio em PyTorch do zero, passo a passo
★ 5.138+49Variação de estrelas nos últimos 7 dias - #8
Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.
★ 4.199+54Variação de estrelas nos últimos 7 dias - #9
Skywork-R1V é uma série avançada de modelos de IA multimodal desenvolvida pela Skywork AI, especializada em raciocínio de visão e linguagem.
★ 3.168+0Variação de estrelas nos últimos 7 dias - #10
verl-agent é uma extensão do veRL, projetada para treinar agentes LLM/VLM via RL. verl-agent é também o código oficial do artigo "Group-in-Group Policy Optimization for LLM Agent Training"
★ 2.274+17Variação de estrelas nos últimos 7 dias - #11
[ECCV 2026] MixGRPO: Desbloqueando a eficiência do GRPO baseado em fluxo com ODE-SDE mistos
★ 1.177+0Variação de estrelas nos últimos 7 dias - #12
A pilha de melhoria contínua para agentes. Nossos dados de ambiente e avaliações impulsionam a melhoria e o monitoramento de agentes.
★ 1.060+2Variação de estrelas nos últimos 7 dias - #13★ 959+64Variação de estrelas nos últimos 7 dias
- #14
🌾 OAT: Uma estrutura amigável para pesquisa de alinhamento online de LLMs, incluindo aprendizado por reforço, aprendizado por preferência, etc.
★ 669-1Variação de estrelas nos últimos 7 dias - #15
[NeurIPS 2025] AutoVLA: Um modelo de Visão-Linguagem-Ação para direção autônoma ponta a ponta com raciocínio adaptativo e ajuste fino por reforço
★ 640+6Variação de estrelas nos últimos 7 dias - #16
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source para LLMs e Cenários de Agentes
★ 632+9Variação de estrelas nos últimos 7 dias - #17
Explore o "Momento Aha" Multimodal em um modelo de 2B
★ 623+0Variação de estrelas nos últimos 7 dias - #18
Uma lista selecionada de artigos sobre aprendizado por reforço para geração de vídeo
★ 591+1Variação de estrelas nos últimos 7 dias - #19
Um Motor de Aprendizado por Reforço Assíncrono para Pós-Treinamento Omni-Modal em Escala
★ 591+11Variação de estrelas nos últimos 7 dias - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Variação de estrelas nos últimos 7 dias