dpo
Repositorios de código abierto monitorizados etiquetados con dpo, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a dpo en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con dpo.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1★ 9383+3Variación de estrellas de los últimos 7 días
- #2
MedicalGPT: Entrena tu propio modelo GPT médico con el pipeline de entrenamiento de ChatGPT. Entrena modelos médicos grandes implementando preentrenamiento incremental (PT), ajuste fino supervisado (SFT), RLHF, DPO, ORPO, GRPO.
★ 5771+12Variación de estrellas de los últimos 7 días - #3
Ajusta LLMs desde un solo YAML. El streaming de capas entrena un modelo de 8B en una GPU de laptop de 4 GB.
★ 4929+1365Variación de estrellas de los últimos 7 días - #4
Align Anything: Entrenamiento de modelos de todas las modalidades con retroalimentación
★ 4671+3Variación de estrellas de los últimos 7 días - #5
🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.
★ 4199+54Variación de estrellas de los últimos 7 días - #6
Una biblioteca con implementaciones extensibles de DPO, KTO, PPO, ORPO y otras funciones de pérdida orientadas a humanos (HALOs).
★ 909-1Variación de estrellas de los últimos 7 días - #7
[ICCV 2025] Código oficial de DeepMesh: Creación autorregresiva de mallas artísticas con aprendizaje por refuerzo
★ 736+1Variación de estrellas de los últimos 7 días - #8
🌾 OAT: Un marco de trabajo amigable para la investigación de alineación en línea de LLM, que incluye aprendizaje por refuerzo, aprendizaje de preferencias, etc.
★ 669-1Variación de estrellas de los últimos 7 días - #9
Ajuste fino (finetuning) fácil y eficiente para LLMs. (Compatible con LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon). Entrenamiento y despliegue eficiente de cuantización para grandes modelos.
★ 621+0Variación de estrellas de los últimos 7 días - #10
Una lista curada de artículos sobre aprendizaje por refuerzo para la generación de video
★ 591+1Variación de estrellas de los últimos 7 días - #11
Repositorio de Deep Learning NLP que utiliza TensorFlow para cubrir desde el preprocesamiento de texto hasta tareas posteriores con modelos modernos como Topic Models, BERT, GPT y LLM.
★ 581+0Variación de estrellas de los últimos 7 días