evaluation
Repositorios de código abierto monitorizados etiquetados con evaluation, ordenados por estrellas.
- #31
¡Compartiendo conocimientos prácticos y teóricos sobre la evaluación de LLM que recopilamos mientras gestionábamos la Open LLM Leaderboard y diseñábamos lighteval!
★ 2143+2Variación de estrellas de los últimos 7 días - #32
Avalanche: una biblioteca de extremo a extremo para aprendizaje continuo basada en PyTorch.
★ 2088+0Variación de estrellas de los últimos 7 días - #33
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Evaluando el estado del arte en IA
★ 2037-2Variación de estrellas de los últimos 7 días - #34
Un evaluador automático para modelos de lenguaje que siguen instrucciones. Validado por humanos, de alta calidad, económico y rápido.
★ 2012-1Variación de estrellas de los últimos 7 días - #35
(IROS 2020, ECCVW 2020) Implementación oficial en Python para "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics"
★ 1846+0Variación de estrellas de los últimos 7 días - #36
WFGY se encamina hacia WFGY 5.0 Polaris Protocol, un importante lanzamiento de código abierto para razonamiento de IA, RAG, agentes y flujos de trabajo del mundo real. Incluye Problem Map, Global Debug Card, WFGY 4.0 y el CFV Easter Egg.
★ 1786+1Variación de estrellas de los últimos 7 días - #37
Modelo de lenguaje grande (LLM) para salud mental, incluyendo pre y post-entrenamiento, conjuntos de datos, evaluación, despliegue y RAG, con modelos de las series InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama y GLM.
★ 1781+1Variación de estrellas de los últimos 7 días - #38
Un framework de Go para construir sistemas de agentes en producción con flujos de trabajo de grafos, herramientas, memoria, A2A, AG-UI, MCP, evaluación y observabilidad.
★ 1760+12Variación de estrellas de los últimos 7 días - #39★ 1668+0Variación de estrellas de los últimos 7 días
- #40
La página oficial de GitHub para el artículo de revisión "A Survey on Evaluation of Large Language Models".
★ 1608-1Variación de estrellas de los últimos 7 días - #41★ 1506+0Variación de estrellas de los últimos 7 días
- #42
Código de evaluación para varias métricas automatizadas no supervisadas para la generación de lenguaje natural.
★ 1391+0Variación de estrellas de los últimos 7 días - #43★ 1300+0Variación de estrellas de los últimos 7 días
- #44★ 1260+0Variación de estrellas de los últimos 7 días
- #45
Un marco para el diagnóstico integral y la optimización de agentes mediante interacciones sintéticas simuladas y realistas
★ 1257+0Variación de estrellas de los últimos 7 días - #46
KernelBench: ¿Pueden los LLMs escribir kernels de GPU? - Benchmark + Kit de herramientas con Torch -> CUDA (+ más DSLs)
★ 1227+7Variación de estrellas de los últimos 7 días - #47
Distribuye y ejecuta cargas de trabajo de IA en Kubernetes de forma mágica con Python, similar a PyTorch para infraestructura de ML.
★ 1224+0Variación de estrellas de los últimos 7 días - #48★ 1206+0Variación de estrellas de los últimos 7 días
- #49
Métricas de rendimiento de alta fidelidad para modelos generativos en PyTorch
★ 1200+1Variación de estrellas de los últimos 7 días - #50
CI/CD nativo de trazas para agentes de IA: los fallos en producción se convierten en pruebas de regresión que bloquean el PR. Detección automática, agrupación, congelación en casos herméticos y reproducción en CI a costo cero.
★ 1176-22Variación de estrellas de los últimos 7 días - #51
NCalc es una biblioteca de evaluación de expresiones rápida y ligera para .NET, diseñada para ofrecer flexibilidad y alto rendimiento. Soporta una amplia gama de operaciones matemáticas y lógicas.
★ 1156+2Variación de estrellas de los últimos 7 días - #52★ 1155+7Variación de estrellas de los últimos 7 días
- #53
Evalúa la respuesta de tu LLM con Prometheus y GPT4 💯
★ 1111+4Variación de estrellas de los últimos 7 días - #54
Implementaciones del SDK de cliente para LangSmith
★ 1048+8Variación de estrellas de los últimos 7 días - #55
API de SemanticKITTI para visualizar conjuntos de datos, procesar información y evaluar resultados.
★ 898+3Variación de estrellas de los últimos 7 días - #56
Generación de datos sintéticos de alta calidad, entrenamiento, medición y evaluación en un único pipeline
★ 885+3Variación de estrellas de los últimos 7 días - #57
ClawProBench es un banco de pruebas orientado a la ejecución en tiempo real para evaluar agentes LLM en el entorno de ejecución OpenClaw, con calificación determinista y fiabilidad en pruebas repetidas.
★ 823+0Variación de estrellas de los últimos 7 días - #58
OpenJudge: un marco unificado para la evaluación holística y recompensas de calidad.
★ 817+12Variación de estrellas de los últimos 7 días - #59★ 814+1Variación de estrellas de los últimos 7 días
- #60
Web Codegen Scorer es una herramienta para evaluar la calidad del código web generado por LLMs
★ 775+4Variación de estrellas de los últimos 7 días