rlhf
Repositórios de código aberto acompanhados marcados com rlhf, ordenados por estrelas.
- #31
Uma biblioteca com implementações extensíveis de DPO, KTO, PPO, ORPO e outras funções de perda orientadas a humanos (HALOs).
★ 909-1Variação de estrelas nos últimos 7 dias - #32
OpenJudge: Uma estrutura unificada para avaliação holística e recompensas de qualidade
★ 817+12Variação de estrelas nos últimos 7 dias - #33
Uma coleção curada de artigos, relatórios técnicos, frameworks e ferramentas para destilação on-policy (OPD) de grandes modelos de linguagem
★ 786+26Variação de estrelas nos últimos 7 dias - #34
RewardBench: a primeira ferramenta de avaliação para modelos de recompensa.
★ 735+2Variação de estrelas nos últimos 7 dias - #35
Trinity-RFT é um framework de propósito geral, flexível e escalável projetado para o ajuste fino por reforço (RFT) de grandes modelos de linguagem (LLM).
★ 698+2Variação de estrelas nos últimos 7 dias - #36
🌾 OAT: Uma estrutura amigável para pesquisa de alinhamento online de LLMs, incluindo aprendizado por reforço, aprendizado por preferência, etc.
★ 669-1Variação de estrelas nos últimos 7 dias - #37
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source para LLMs e Cenários de Agentes
★ 632+9Variação de estrelas nos últimos 7 dias - #38
Fine-tuning fácil e eficiente de LLMs. (Suporta LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Treinamento e implantação eficientes de quantização para grandes modelos.
★ 621+0Variação de estrelas nos últimos 7 dias - #39
Um Motor de Aprendizado por Reforço Assíncrono para Pós-Treinamento Omni-Modal em Escala
★ 591+10Variação de estrelas nos últimos 7 dias - #40★ 589+0Variação de estrelas nos últimos 7 dias
- #41
Implementação de ChatGPT RLHF (Aprendizado por Reforço com Feedback Humano) em qualquer modelo de geração no transformers da huggingface (bloomz-176B/bloom/gpt/bart/T5/MetaICL)
★ 564+0Variação de estrelas nos últimos 7 dias - #42
Uma receita para RLHF online e DPO iterativo online.
★ 544+0Variação de estrelas nos últimos 7 dias - #43
A curated collection of papers and resources on On-Policy Distillation for Large Language Models.
★ 534+9Variação de estrelas nos últimos 7 dias - #44
[ICLR 2026] Código oficial para TraceRL: Revolucionando o pós-treinamento para LLMs de Difusão, impulsionando a série SOTA TraDo.
★ 520+1Variação de estrelas nos últimos 7 dias