reinforcement-learning-from-human-feedback
Repositorios de código abierto monitorizados etiquetados con reinforcement-learning-from-human-feedback, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a reinforcement-learning-from-human-feedback en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con reinforcement-learning-from-human-feedback.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Un framework de RL basado en agentes fácil de usar, escalable y de alto rendimiento basado en Ray (PPO y DAPO y REINFORCE++ y VLM y TIS y vLLM y Ray y Async RL)
★ 9969+9Variación de estrellas de los últimos 7 días - #2
Safe RLHF: Alineación de valores restringida mediante aprendizaje por refuerzo seguro a partir de retroalimentación humana
★ 1613+1Variación de estrellas de los últimos 7 días - #3
Un marco de simulación para RLHF y alternativas. Desarrolle su método de RLHF sin recopilar datos humanos.
★ 844-1Variación de estrellas de los últimos 7 días