Pular para o conteúdo principal
buildradar
Sign in
Tópico · rlhf

rlhf

Repositórios de código aberto acompanhados marcados com rlhf, ordenados por estrelas.

44 repositórios
  • HALOs@ContextualAI

    Uma biblioteca com implementações extensíveis de DPO, KTO, PPO, ORPO e outras funções de perda orientadas a humanos (HALOs).

    909-1Variação de estrelas nos últimos 7 dias
  • OpenJudge@agentscope-ai

    OpenJudge: Uma estrutura unificada para avaliação holística e recompensas de qualidade

    817+12Variação de estrelas nos últimos 7 dias
  • Uma coleção curada de artigos, relatórios técnicos, frameworks e ferramentas para destilação on-policy (OPD) de grandes modelos de linguagem

    786+26Variação de estrelas nos últimos 7 dias
  • reward-bench@allenai

    RewardBench: a primeira ferramenta de avaliação para modelos de recompensa.

    735+2Variação de estrelas nos últimos 7 dias
  • Trinity-RFT@agentscope-ai

    Trinity-RFT é um framework de propósito geral, flexível e escalável projetado para o ajuste fino por reforço (RFT) de grandes modelos de linguagem (LLM).

    698+2Variação de estrelas nos últimos 7 dias
  • oat@sail-sg

    🌾 OAT: Uma estrutura amigável para pesquisa de alinhamento online de LLMs, incluindo aprendizado por reforço, aprendizado por preferência, etc.

    669-1Variação de estrelas nos últimos 7 dias
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source para LLMs e Cenários de Agentes

    632+9Variação de estrelas nos últimos 7 dias
  • LLamaTuner@jianzhnie

    Fine-tuning fácil e eficiente de LLMs. (Suporta LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Treinamento e implantação eficientes de quantização para grandes modelos.

    621+0Variação de estrelas nos últimos 7 dias
  • Relax@redai-studio

    Um Motor de Aprendizado por Reforço Assíncrono para Pós-Treinamento Omni-Modal em Escala

    591+10Variação de estrelas nos últimos 7 dias
  • SPPO@uclaml

    A implementação oficial do Self-Play Preference Optimization (SPPO)

    589+0Variação de estrelas nos últimos 7 dias
  • TextRL@voidful

    Implementação de ChatGPT RLHF (Aprendizado por Reforço com Feedback Humano) em qualquer modelo de geração no transformers da huggingface (bloomz-176B/bloom/gpt/bart/T5/MetaICL)

    564+0Variação de estrelas nos últimos 7 dias
  • Online-RLHF@RLHFlow

    Uma receita para RLHF online e DPO iterativo online.

    544+0Variação de estrelas nos últimos 7 dias
  • A curated collection of papers and resources on On-Policy Distillation for Large Language Models.

    534+9Variação de estrelas nos últimos 7 dias
  • dLLM-RL@Gen-Verse

    [ICLR 2026] Código oficial para TraceRL: Revolucionando o pós-treinamento para LLMs de Difusão, impulsionando a série SOTA TraDo.

    520+1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos