Saltar al contenido principal
buildradar
Sign in
Tema · dpo

dpo

Repositorios de código abierto monitorizados etiquetados con dpo, ordenados por estrellas.

Repositorios
11
Estrellas totales
33.060
Estrellas de media
3005
Proporción
0,00%

Temas que aparecen con frecuencia junto a dpo en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con dpo.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • oumi@oumi-ai

    ¡Ajusta, evalúa y despliega fácilmente Qwen, Gemma o cualquier LLM de pesos abiertos!

    9383+3Variación de estrellas de los últimos 7 días
  • MedicalGPT@shibing624

    MedicalGPT: Entrena tu propio modelo GPT médico con el pipeline de entrenamiento de ChatGPT. Entrena modelos médicos grandes implementando preentrenamiento incremental (PT), ajuste fino supervisado (SFT), RLHF, DPO, ORPO, GRPO.

    5771+12Variación de estrellas de los últimos 7 días
  • Soup@MakazhanAlpamys

    Ajusta LLMs desde un solo YAML. El streaming de capas entrena un modelo de 8B en una GPU de laptop de 4 GB.

    4929+1365Variación de estrellas de los últimos 7 días
  • align-anything@PKU-Alignment

    Align Anything: Entrenamiento de modelos de todas las modalidades con retroalimentación

    4671+3Variación de estrellas de los últimos 7 días
  • hands-on-modern-rl@walkinglabs

    🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.

    4199+54Variación de estrellas de los últimos 7 días
  • HALOs@ContextualAI

    Una biblioteca con implementaciones extensibles de DPO, KTO, PPO, ORPO y otras funciones de pérdida orientadas a humanos (HALOs).

    909-1Variación de estrellas de los últimos 7 días
  • DeepMesh@zhaorw02

    [ICCV 2025] Código oficial de DeepMesh: Creación autorregresiva de mallas artísticas con aprendizaje por refuerzo

    736+1Variación de estrellas de los últimos 7 días
  • oat@sail-sg

    🌾 OAT: Un marco de trabajo amigable para la investigación de alineación en línea de LLM, que incluye aprendizaje por refuerzo, aprendizaje de preferencias, etc.

    669-1Variación de estrellas de los últimos 7 días
  • LLamaTuner@jianzhnie

    Ajuste fino (finetuning) fácil y eficiente para LLMs. (Compatible con LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon). Entrenamiento y despliegue eficiente de cuantización para grandes modelos.

    621+0Variación de estrellas de los últimos 7 días
  • Una lista curada de artículos sobre aprendizaje por refuerzo para la generación de video

    591+1Variación de estrellas de los últimos 7 días
  • tensorflow-nlp-tutorial@ukairia777

    Repositorio de Deep Learning NLP que utiliza TensorFlow para cubrir desde el preprocesamiento de texto hasta tareas posteriores con modelos modernos como Topic Models, BERT, GPT y LLM.

    581+0Variación de estrellas de los últimos 7 días
← Volver a temas