Pular para o conteúdo principal
buildradar
Sign in
Tópico · grpo

grpo

Repositórios de código aberto acompanhados marcados com grpo, ordenados por estrelas.

Repositórios
20
Total de estrelas
81.418
Média de estrelas
4.071
Participação
0,00%

Tópicos que aparecem com frequência ao lado de grpo no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com grpo.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • ms-swift@modelscope

    Use PEFT ou Full-parameter para CPT/SFT/DPO/GRPO em mais de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) e mais de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

    15.488+88Variação de estrelas nos últimos 7 dias
  • AI-Research-SKILLs@Orchestra-Research

    Biblioteca de código aberto abrangente de habilidades de engenharia e pesquisa em IA para qualquer modelo. Empacote as habilidades e seu agente Claude Code/Codex/Gemini se tornará um agente de pesquisa em IA de alto desempenho. Mantido pela Orchestra Research.

    12.256+104Variação de estrelas nos últimos 7 dias
  • ART@OpenPipe

    Agent Reinforcement Trainer: treine agentes de múltiplas etapas para tarefas do mundo real usando GRPO. Dê aos seus agentes treinamento prático. Aprendizado por reforço para Qwen3.6, GPT-OSS, Llama e muito mais!

    10.689+10Variação de estrelas nos últimos 7 dias
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | Guia de desenvolvimento de agentes de IA | Prática de LangGraph | RAG avançado | Transição para LLMs | Entrevistas de LLM | Engenheiro de algoritmos | Banco de questões de entrevista | Aprendizado por reforço | Síntese de dados.

    9.116+169Variação de estrelas nos últimos 7 dias
  • VLM-R1@om-ai-lab

    Resolver compreensão visual com VLMs reforçados.

    6.018+4Variação de estrelas nos últimos 7 dias
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Treine qualquer agente simplesmente conversando

    5.665+7Variação de estrelas nos últimos 7 dias
  • reasoning-from-scratch@rasbt

    Implemente um LLM de raciocínio em PyTorch do zero, passo a passo

    5.138+49Variação de estrelas nos últimos 7 dias
  • hands-on-modern-rl@walkinglabs

    Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.

    4.199+54Variação de estrelas nos últimos 7 dias
  • Skywork-R1V@SkyworkAI

    Skywork-R1V é uma série avançada de modelos de IA multimodal desenvolvida pela Skywork AI, especializada em raciocínio de visão e linguagem.

    3.168+0Variação de estrelas nos últimos 7 dias
  • verl-agent@langfengQ

    verl-agent é uma extensão do veRL, projetada para treinar agentes LLM/VLM via RL. verl-agent é também o código oficial do artigo "Group-in-Group Policy Optimization for LLM Agent Training"

    2.274+17Variação de estrelas nos últimos 7 dias
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Desbloqueando a eficiência do GRPO baseado em fluxo com ODE-SDE mistos

    1.177+0Variação de estrelas nos últimos 7 dias
  • judgeval@JudgmentLabs

    A pilha de melhoria contínua para agentes. Nossos dados de ambiente e avaliações impulsionam a melhoria e o monitoramento de agentes.

    1.060+2Variação de estrelas nos últimos 7 dias
  • verl-omni@verl-project

    Framework de treinamento de RL multimodal para modelos de difusão e omni

    959+64Variação de estrelas nos últimos 7 dias
  • oat@sail-sg

    🌾 OAT: Uma estrutura amigável para pesquisa de alinhamento online de LLMs, incluindo aprendizado por reforço, aprendizado por preferência, etc.

    669-1Variação de estrelas nos últimos 7 dias
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA: Um modelo de Visão-Linguagem-Ação para direção autônoma ponta a ponta com raciocínio adaptativo e ajuste fino por reforço

    640+6Variação de estrelas nos últimos 7 dias
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source para LLMs e Cenários de Agentes

    632+9Variação de estrelas nos últimos 7 dias
  • VisualThinker-R1-Zero@turningpoint-ai

    Explore o "Momento Aha" Multimodal em um modelo de 2B

    623+0Variação de estrelas nos últimos 7 dias
  • Uma lista selecionada de artigos sobre aprendizado por reforço para geração de vídeo

    591+1Variação de estrelas nos últimos 7 dias
  • Relax@redai-studio

    Um Motor de Aprendizado por Reforço Assíncrono para Pós-Treinamento Omni-Modal em Escala

    591+11Variação de estrelas nos últimos 7 dias
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos