rlhf
Repositorios de código abierto monitorizados etiquetados con rlhf, ordenados por estrellas.
- #31
Una biblioteca con implementaciones extensibles de DPO, KTO, PPO, ORPO y otras funciones de pérdida orientadas a humanos (HALOs).
★ 909-1Variación de estrellas de los últimos 7 días - #32
OpenJudge: un marco unificado para la evaluación holística y recompensas de calidad.
★ 819+12Variación de estrellas de los últimos 7 días - #33
Una colección curada de artículos, informes técnicos, marcos de trabajo y herramientas para la destilación on-policy (OPD) de modelos de lenguaje de gran tamaño.
★ 791+26Variación de estrellas de los últimos 7 días - #34
RewardBench: la primera herramienta de evaluación para modelos de recompensa.
★ 735+2Variación de estrellas de los últimos 7 días - #35
Trinity-RFT es un framework de propósito general, flexible y escalable, diseñado para el ajuste fino por refuerzo (RFT) de modelos de lenguaje de gran tamaño (LLM).
★ 698+2Variación de estrellas de los últimos 7 días - #36
🌾 OAT: Un marco de trabajo amigable para la investigación de alineación en línea de LLM, que incluye aprendizaje por refuerzo, aprendizaje de preferencias, etc.
★ 669-1Variación de estrellas de los últimos 7 días - #37
RLAnything (ICML 2026) y AutoTool (ICML 2026), DemyAgent: RL de código abierto para LLMs y escenarios de agentes
★ 632+9Variación de estrellas de los últimos 7 días - #38
Ajuste fino (finetuning) fácil y eficiente para LLMs. (Compatible con LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon). Entrenamiento y despliegue eficiente de cuantización para grandes modelos.
★ 621+0Variación de estrellas de los últimos 7 días - #39
Un motor de aprendizaje por refuerzo asíncrono para el post-entrenamiento omnimodal a gran escala.
★ 591+10Variación de estrellas de los últimos 7 días - #40★ 589+0Variación de estrellas de los últimos 7 días
- #41
Implementación de RLHF (aprendizaje por refuerzo con retroalimentación humana) de ChatGPT en cualquier modelo generativo de los transformers de huggingface (blommz-176B/bloom/gpt/bart/T5/MetaICL).
★ 564+0Variación de estrellas de los últimos 7 días - #42
Una receta para RLHF en línea y DPO iterativo en línea.
★ 544+0Variación de estrellas de los últimos 7 días - #43
Una colección curada de artículos y recursos sobre destilación on-policy para modelos de lenguaje grandes.
★ 534+9Variación de estrellas de los últimos 7 días - #44
[ICLR 2026] Código oficial para TraceRL: Revolucionando el post-entrenamiento para LLM de difusión, impulsando la serie SOTA TraDo.
★ 520+1Variación de estrellas de los últimos 7 días