Saltar al contenido principal
buildradar
Sign in
Tema · rlhf

rlhf

Repositorios de código abierto monitorizados etiquetados con rlhf, ordenados por estrellas.

Repositorios
44
Estrellas totales
223.657
Estrellas de media
5083
Proporción
0,01%

Temas que aparecen con frecuencia junto a rlhf en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con rlhf.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • LlamaFactory@hiyouga

    Ajuste fino eficiente y unificado de más de 100 LLMs y VLMs (ACL 2024)

    74.532+89Variación de estrellas de los últimos 7 días
  • Open-Assistant@LAION-AI

    OpenAssistant es un asistente basado en chat que comprende tareas, puede interactuar con sistemas de terceros y recuperar información de forma dinámica para lograrlo.

    37.401-7Variación de estrellas de los últimos 7 días
  • LLMSurvey@RUCAIBox

    La página oficial de GitHub para el artículo de revisión "A Survey of Large Language Models".

    12.208+2Variación de estrellas de los últimos 7 días
  • InternLM@InternLM

    Lanzamiento oficial de la serie InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).

    7277+4Variación de estrellas de los últimos 7 días
  • Proyecto de segunda fase de LLaMA-2 y Alpaca-2 en chino + modelo de contexto ultra largo de 64K (LLaMA-2 y Alpaca-2 LLMs en chino con modelos de contexto largo de 64K)

    7120+0Variación de estrellas de los últimos 7 días
  • alignment-handbook@huggingface

    Recetas robustas para alinear modelos de lenguaje con las preferencias humanas y de la IA

    5670-3Variación de estrellas de los últimos 7 días
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Entrena cualquier agente simplemente hablando

    5665+7Variación de estrellas de los últimos 7 días
  • transformerlab-app@transformerlab

    El entorno de investigación de código abierto para que los investigadores de IA entrenen, evalúen y escalen modelos sin problemas desde hardware local hasta clústeres de GPU.

    5185+3Variación de estrellas de los últimos 7 días
  • reasoning-from-scratch@rasbt

    Implementa un LLM de razonamiento en PyTorch desde cero, paso a paso

    5138+49Variación de estrellas de los últimos 7 días
  • argilla@argilla-io

    Argilla es una herramienta de colaboración para ingenieros de IA y expertos en dominios para construir conjuntos de datos de alta calidad

    5093+5Variación de estrellas de los últimos 7 días
  • Kiln@Kiln-AI

    Construye, evalúa y optimiza sistemas de IA. Incluye evaluaciones, RAG, agentes, ajuste fino, generación de datos sintéticos, gestión de conjuntos de datos, MCP y más.

    5042+5Variación de estrellas de los últimos 7 días
  • align-anything@PKU-Alignment

    Align Anything: Entrenamiento de modelos de todas las modalidades con retroalimentación

    4671+3Variación de estrellas de los últimos 7 días
  • awesome-RLHF@opendilab

    Una lista seleccionada de recursos sobre aprendizaje por refuerzo con retroalimentación humana (actualizada continuamente)

    4424+2Variación de estrellas de los últimos 7 días
  • hands-on-modern-rl@walkinglabs

    🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.

    4199+54Variación de estrellas de los últimos 7 días
  • docta@Docta-ai

    Un doctor para tus datos

    3485-1Variación de estrellas de los últimos 7 días
  • distilabel@argilla-io

    Distilabel es un framework para datos sintéticos y retroalimentación de IA para ingenieros que necesitan flujos rápidos, confiables y escalables basados en artículos de investigación verificados.

    3384+3Variación de estrellas de los últimos 7 días
  • ROLL@alibaba

    Una biblioteca de escalado eficiente y fácil de usar para el aprendizaje por refuerzo con Large Language Models

    3380+6Variación de estrellas de los últimos 7 días
  • TorchLeet@Exorust

    LeetCode para PyTorch: 65 problemas de entrevistas de ML/AI de entrevistas reales en Google, Meta, Anthropic. Incluye notebooks de Jupyter, un evaluador automático y un tutor de IA MCP.

    2461+12Variación de estrellas de los últimos 7 días
  • rlhf-book@natolambert

    Libro de texto sobre el aprendizaje por refuerzo a partir de retroalimentación humana

    2357+11Variación de estrellas de los últimos 7 días
  • alpaca_eval@tatsu-lab

    Un evaluador automático para modelos de lenguaje que siguen instrucciones. Validado por humanos, de alta calidad, económico y rápido.

    2012-1Variación de estrellas de los últimos 7 días
  • AgentsMeetRL@thinkwee

    Lista de recursos destacados sobre aprendizaje por refuerzo basado en agentes (Agentic RL)

    1832+29Variación de estrellas de los últimos 7 días
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward: Aprendizaje y evaluación de preferencias humanas para la generación de texto a imagen.

    1703+1Variación de estrellas de los últimos 7 días
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Alineación de valores restringida mediante aprendizaje por refuerzo seguro a partir de retroalimentación humana

    1613+1Variación de estrellas de los últimos 7 días
  • WebGLM@THUDM

    WebGLM: Un sistema eficiente de preguntas y respuestas mejorado por la web (KDD 2023)

    1601-1Variación de estrellas de los últimos 7 días
  • Recetas para entrenar modelos de recompensa para RLHF.

    1541+0Variación de estrellas de los últimos 7 días
  • MOSS-RLHF@OpenLMLab

    Secretos de RLHF en Modelos de Lenguaje Grandes Parte I: PPO

    1430+0Variación de estrellas de los últimos 7 días
  • xtreme1@xtreme1-io

    Xtreme1 es una plataforma integral de etiquetado y anotación de datos para el entrenamiento de datos multimodales, compatible con nubes de puntos LiDAR 3D, imágenes y LLM.

    1239+2Variación de estrellas de los últimos 7 días
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO: Optimización de preferencias simple con recompensa sin referencia.

    959+1Variación de estrellas de los últimos 7 días
  • verl-omni@verl-project

    Framework de entrenamiento de aprendizaje por refuerzo multimodal para modelos de difusión y omnimodales

    955+60Variación de estrellas de los últimos 7 días
  • AI-Compass@tingaicompass

    AI-Compass guía a la comunidad a través del océano de la tecnología de IA, ofreciendo rutas para principiantes y desarrolladores avanzados. Su objetivo es ayudar a los desarrolladores a comprender sistemáticamente los conceptos centrales, las tecnologías principales y las tendencias de vanguardia de la IA, dominando el proceso desde la teoría hasta la implementación práctica.

    933+10Variación de estrellas de los últimos 7 días
← Volver a temas