Saltar al contenido principal
buildradar
Sign in
Tema · rlhf

rlhf

Repositorios de código abierto monitorizados etiquetados con rlhf, ordenados por estrellas.

44 repositorios
  • HALOs@ContextualAI

    Una biblioteca con implementaciones extensibles de DPO, KTO, PPO, ORPO y otras funciones de pérdida orientadas a humanos (HALOs).

    909-1Variación de estrellas de los últimos 7 días
  • OpenJudge@agentscope-ai

    OpenJudge: un marco unificado para la evaluación holística y recompensas de calidad.

    819+12Variación de estrellas de los últimos 7 días
  • Una colección curada de artículos, informes técnicos, marcos de trabajo y herramientas para la destilación on-policy (OPD) de modelos de lenguaje de gran tamaño.

    791+26Variación de estrellas de los últimos 7 días
  • reward-bench@allenai

    RewardBench: la primera herramienta de evaluación para modelos de recompensa.

    735+2Variación de estrellas de los últimos 7 días
  • Trinity-RFT@agentscope-ai

    Trinity-RFT es un framework de propósito general, flexible y escalable, diseñado para el ajuste fino por refuerzo (RFT) de modelos de lenguaje de gran tamaño (LLM).

    698+2Variación de estrellas de los últimos 7 días
  • oat@sail-sg

    🌾 OAT: Un marco de trabajo amigable para la investigación de alineación en línea de LLM, que incluye aprendizaje por refuerzo, aprendizaje de preferencias, etc.

    669-1Variación de estrellas de los últimos 7 días
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) y AutoTool (ICML 2026), DemyAgent: RL de código abierto para LLMs y escenarios de agentes

    632+9Variación de estrellas de los últimos 7 días
  • LLamaTuner@jianzhnie

    Ajuste fino (finetuning) fácil y eficiente para LLMs. (Compatible con LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon). Entrenamiento y despliegue eficiente de cuantización para grandes modelos.

    621+0Variación de estrellas de los últimos 7 días
  • Relax@redai-studio

    Un motor de aprendizaje por refuerzo asíncrono para el post-entrenamiento omnimodal a gran escala.

    591+10Variación de estrellas de los últimos 7 días
  • SPPO@uclaml

    La implementación oficial de Self-Play Preference Optimization (SPPO)

    589+0Variación de estrellas de los últimos 7 días
  • TextRL@voidful

    Implementación de RLHF (aprendizaje por refuerzo con retroalimentación humana) de ChatGPT en cualquier modelo generativo de los transformers de huggingface (blommz-176B/bloom/gpt/bart/T5/MetaICL).

    564+0Variación de estrellas de los últimos 7 días
  • Online-RLHF@RLHFlow

    Una receta para RLHF en línea y DPO iterativo en línea.

    544+0Variación de estrellas de los últimos 7 días
  • Una colección curada de artículos y recursos sobre destilación on-policy para modelos de lenguaje grandes.

    534+9Variación de estrellas de los últimos 7 días
  • dLLM-RL@Gen-Verse

    [ICLR 2026] Código oficial para TraceRL: Revolucionando el post-entrenamiento para LLM de difusión, impulsando la serie SOTA TraDo.

    520+1Variación de estrellas de los últimos 7 días
← Volver a temas