rlhf
Repositorios de código abierto monitorizados etiquetados con rlhf, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a rlhf en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con rlhf.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Ajuste fino eficiente y unificado de más de 100 LLMs y VLMs (ACL 2024)
★ 74.532+89Variación de estrellas de los últimos 7 días - #2
OpenAssistant es un asistente basado en chat que comprende tareas, puede interactuar con sistemas de terceros y recuperar información de forma dinámica para lograrlo.
★ 37.401-7Variación de estrellas de los últimos 7 días - #3
La página oficial de GitHub para el artículo de revisión "A Survey of Large Language Models".
★ 12.208+2Variación de estrellas de los últimos 7 días - #4
Lanzamiento oficial de la serie InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).
★ 7277+4Variación de estrellas de los últimos 7 días - #5
Proyecto de segunda fase de LLaMA-2 y Alpaca-2 en chino + modelo de contexto ultra largo de 64K (LLaMA-2 y Alpaca-2 LLMs en chino con modelos de contexto largo de 64K)
★ 7120+0Variación de estrellas de los últimos 7 días - #6
Recetas robustas para alinear modelos de lenguaje con las preferencias humanas y de la IA
★ 5670-3Variación de estrellas de los últimos 7 días - #7
OpenClaw-RL: Entrena cualquier agente simplemente hablando
★ 5665+7Variación de estrellas de los últimos 7 días - #8
El entorno de investigación de código abierto para que los investigadores de IA entrenen, evalúen y escalen modelos sin problemas desde hardware local hasta clústeres de GPU.
★ 5185+3Variación de estrellas de los últimos 7 días - #9
Implementa un LLM de razonamiento en PyTorch desde cero, paso a paso
★ 5138+49Variación de estrellas de los últimos 7 días - #10
Argilla es una herramienta de colaboración para ingenieros de IA y expertos en dominios para construir conjuntos de datos de alta calidad
★ 5093+5Variación de estrellas de los últimos 7 días - #11
Construye, evalúa y optimiza sistemas de IA. Incluye evaluaciones, RAG, agentes, ajuste fino, generación de datos sintéticos, gestión de conjuntos de datos, MCP y más.
★ 5042+5Variación de estrellas de los últimos 7 días - #12
Align Anything: Entrenamiento de modelos de todas las modalidades con retroalimentación
★ 4671+3Variación de estrellas de los últimos 7 días - #13
Una lista seleccionada de recursos sobre aprendizaje por refuerzo con retroalimentación humana (actualizada continuamente)
★ 4424+2Variación de estrellas de los últimos 7 días - #14
🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.
★ 4199+54Variación de estrellas de los últimos 7 días - #15★ 3485-1Variación de estrellas de los últimos 7 días
- #16
Distilabel es un framework para datos sintéticos y retroalimentación de IA para ingenieros que necesitan flujos rápidos, confiables y escalables basados en artículos de investigación verificados.
★ 3384+3Variación de estrellas de los últimos 7 días - #17
Una biblioteca de escalado eficiente y fácil de usar para el aprendizaje por refuerzo con Large Language Models
★ 3380+6Variación de estrellas de los últimos 7 días - #18
LeetCode para PyTorch: 65 problemas de entrevistas de ML/AI de entrevistas reales en Google, Meta, Anthropic. Incluye notebooks de Jupyter, un evaluador automático y un tutor de IA MCP.
★ 2461+12Variación de estrellas de los últimos 7 días - #19
Libro de texto sobre el aprendizaje por refuerzo a partir de retroalimentación humana
★ 2357+11Variación de estrellas de los últimos 7 días - #20
Un evaluador automático para modelos de lenguaje que siguen instrucciones. Validado por humanos, de alta calidad, económico y rápido.
★ 2012-1Variación de estrellas de los últimos 7 días - #21
Lista de recursos destacados sobre aprendizaje por refuerzo basado en agentes (Agentic RL)
★ 1832+29Variación de estrellas de los últimos 7 días - #22
[NeurIPS 2023] ImageReward: Aprendizaje y evaluación de preferencias humanas para la generación de texto a imagen.
★ 1703+1Variación de estrellas de los últimos 7 días - #23
Safe RLHF: Alineación de valores restringida mediante aprendizaje por refuerzo seguro a partir de retroalimentación humana
★ 1613+1Variación de estrellas de los últimos 7 días - #24★ 1601-1Variación de estrellas de los últimos 7 días
- #25
Recetas para entrenar modelos de recompensa para RLHF.
★ 1541+0Variación de estrellas de los últimos 7 días - #26★ 1430+0Variación de estrellas de los últimos 7 días
- #27
Xtreme1 es una plataforma integral de etiquetado y anotación de datos para el entrenamiento de datos multimodales, compatible con nubes de puntos LiDAR 3D, imágenes y LLM.
★ 1239+2Variación de estrellas de los últimos 7 días - #28
[NeurIPS 2024] SimPO: Optimización de preferencias simple con recompensa sin referencia.
★ 959+1Variación de estrellas de los últimos 7 días - #29
Framework de entrenamiento de aprendizaje por refuerzo multimodal para modelos de difusión y omnimodales
★ 955+60Variación de estrellas de los últimos 7 días - #30
AI-Compass guía a la comunidad a través del océano de la tecnología de IA, ofreciendo rutas para principiantes y desarrolladores avanzados. Su objetivo es ayudar a los desarrolladores a comprender sistemáticamente los conceptos centrales, las tecnologías principales y las tendencias de vanguardia de la IA, dominando el proceso desde la teoría hasta la implementación práctica.
★ 933+10Variación de estrellas de los últimos 7 días