Pular para o conteúdo principal
buildradar
Sign in
Tópico · dpo

dpo

Repositórios de código aberto acompanhados marcados com dpo, ordenados por estrelas.

Repositórios
11
Total de estrelas
33.060
Média de estrelas
3.005
Participação
0,00%

Tópicos que aparecem com frequência ao lado de dpo no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com dpo.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • oumi@oumi-ai

    Faça o ajuste fino, avalie e implante facilmente Qwen, Gemma ou qualquer LLM de pesos abertos!

    9.383+3Variação de estrelas nos últimos 7 dias
  • MedicalGPT@shibing624

    MedicalGPT: Treine seu próprio modelo GPT médico com o pipeline de treinamento do ChatGPT. Implementa pré-treinamento incremental (PT), ajuste fino supervisionado (SFT), RLHF, DPO, ORPO e GRPO.

    5.771+12Variação de estrelas nos últimos 7 dias
  • Soup@MakazhanAlpamys

    Ajuste fino de LLMs a partir de um único YAML. O streaming de camadas treina um modelo de 8B em uma GPU de laptop de 4 GB.

    4.929+1.365Variação de estrelas nos últimos 7 dias
  • align-anything@PKU-Alignment

    Align Anything: Treinamento de modelos multimodais com feedback

    4.671+3Variação de estrelas nos últimos 7 dias
  • hands-on-modern-rl@walkinglabs

    Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.

    4.199+54Variação de estrelas nos últimos 7 dias
  • HALOs@ContextualAI

    Uma biblioteca com implementações extensíveis de DPO, KTO, PPO, ORPO e outras funções de perda orientadas a humanos (HALOs).

    909-1Variação de estrelas nos últimos 7 dias
  • DeepMesh@zhaorw02

    [ICCV 2025] Código oficial do DeepMesh: Criação Auto-Regressiva de Malhas de Artista com Aprendizagem por Reforço

    736+1Variação de estrelas nos últimos 7 dias
  • oat@sail-sg

    🌾 OAT: Uma estrutura amigável para pesquisa de alinhamento online de LLMs, incluindo aprendizado por reforço, aprendizado por preferência, etc.

    669-1Variação de estrelas nos últimos 7 dias
  • LLamaTuner@jianzhnie

    Fine-tuning fácil e eficiente de LLMs. (Suporta LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Treinamento e implantação eficientes de quantização para grandes modelos.

    621+0Variação de estrelas nos últimos 7 dias
  • Uma lista selecionada de artigos sobre aprendizado por reforço para geração de vídeo

    591+1Variação de estrelas nos últimos 7 dias
  • tensorflow-nlp-tutorial@ukairia777

    Este é um repositório de NLP de Deep Learning que organiza desde o pré-processamento de texto usando TensorFlow até tarefas downstream de modelos modernos como Topic Models, BERT, GPT e LLM.

    581+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos