dpo
Repositórios de código aberto acompanhados marcados com dpo, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de dpo no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com dpo.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Faça o ajuste fino, avalie e implante facilmente Qwen, Gemma ou qualquer LLM de pesos abertos!
★ 9.383+3Variação de estrelas nos últimos 7 dias - #2
MedicalGPT: Treine seu próprio modelo GPT médico com o pipeline de treinamento do ChatGPT. Implementa pré-treinamento incremental (PT), ajuste fino supervisionado (SFT), RLHF, DPO, ORPO e GRPO.
★ 5.771+12Variação de estrelas nos últimos 7 dias - #3
Ajuste fino de LLMs a partir de um único YAML. O streaming de camadas treina um modelo de 8B em uma GPU de laptop de 4 GB.
★ 4.929+1.365Variação de estrelas nos últimos 7 dias - #4
Align Anything: Treinamento de modelos multimodais com feedback
★ 4.671+3Variação de estrelas nos últimos 7 dias - #5
Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.
★ 4.199+54Variação de estrelas nos últimos 7 dias - #6
Uma biblioteca com implementações extensíveis de DPO, KTO, PPO, ORPO e outras funções de perda orientadas a humanos (HALOs).
★ 909-1Variação de estrelas nos últimos 7 dias - #7
[ICCV 2025] Código oficial do DeepMesh: Criação Auto-Regressiva de Malhas de Artista com Aprendizagem por Reforço
★ 736+1Variação de estrelas nos últimos 7 dias - #8
🌾 OAT: Uma estrutura amigável para pesquisa de alinhamento online de LLMs, incluindo aprendizado por reforço, aprendizado por preferência, etc.
★ 669-1Variação de estrelas nos últimos 7 dias - #9
Fine-tuning fácil e eficiente de LLMs. (Suporta LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Treinamento e implantação eficientes de quantização para grandes modelos.
★ 621+0Variação de estrelas nos últimos 7 dias - #10
Uma lista selecionada de artigos sobre aprendizado por reforço para geração de vídeo
★ 591+1Variação de estrelas nos últimos 7 dias - #11
Este é um repositório de NLP de Deep Learning que organiza desde o pré-processamento de texto usando TensorFlow até tarefas downstream de modelos modernos como Topic Models, BERT, GPT e LLM.
★ 581+0Variação de estrelas nos últimos 7 dias