benchmark
Repositorios de código abierto monitorizados etiquetados con benchmark, ordenados por estrellas.
- #61
¡Evalúa LLMs haciéndolos pelear en Street Fighter 3! La nueva forma de evaluar la calidad de un LLM.
★ 1483-1Variación de estrellas de los últimos 7 días - #62
Fixture de pytest para realizar pruebas de rendimiento de código
★ 1448+0Variación de estrellas de los últimos 7 días - #63★ 1444+2Variación de estrellas de los últimos 7 días
- #64
[pip install medmnist] 18 conjuntos de datos estandarizados para la clasificación de imágenes biomédicas 2D y 3D
★ 1399+0Variación de estrellas de los últimos 7 días - #65
Compilador rápido para árboles de expresión de C# y la alternativa ligera LightExpression. Herramientas de diagnóstico y generación de código para expresiones.
★ 1375+1Variación de estrellas de los últimos 7 días - #66★ 1367+1Variación de estrellas de los últimos 7 días
- #67
Framework modular de aprendizaje por refuerzo profundo en PyTorch. Biblioteca complementaria del libro "Foundations of Deep Reinforcement Learning"
★ 1362+0Variación de estrellas de los últimos 7 días - #68
Últimos avances en razonamiento System-2
★ 1353+0Variación de estrellas de los últimos 7 días - #69★ 1266+6Variación de estrellas de los últimos 7 días
- #70
GitHub Action para benchmarking continuo con el fin de mantener el rendimiento
★ 1251+1Variación de estrellas de los últimos 7 días - #71★ 1237+0Variación de estrellas de los últimos 7 días
- #72★ 1232+2Variación de estrellas de los últimos 7 días
- #73
KernelBench: ¿Pueden los LLMs escribir kernels de GPU? - Benchmark + Kit de herramientas con Torch -> CUDA (+ más DSLs)
★ 1227+13Variación de estrellas de los últimos 7 días - #74★ 1192+1Variación de estrellas de los últimos 7 días
- #75
Una compilación de scripts de evaluación comparativa (benchmarking) para servidores Linux.
★ 1190+0Variación de estrellas de los últimos 7 días - #76★ 1188+0Variación de estrellas de los últimos 7 días
- #77
Banco de pruebas para bases de datos vectoriales.
★ 1173+7Variación de estrellas de los últimos 7 días - #78
JMLR: OmniSafe es un marco de infraestructura para acelerar la investigación en SafeRL.
★ 1150+1Variación de estrellas de los últimos 7 días - #79★ 1143+6Variación de estrellas de los últimos 7 días
- #80
Generador rápido de números primos.
★ 1114+2Variación de estrellas de los últimos 7 días - #81
ClickBench: una prueba de rendimiento para bases de datos analíticas
★ 1094+3Variación de estrellas de los últimos 7 días - #82★ 1083+3Variación de estrellas de los últimos 7 días
- #83
Herramienta de generación de tráfico y evaluación comparativa para NoSQL Redis y Memcache.
★ 1053+4Variación de estrellas de los últimos 7 días - #84
Model Zoo para OpenCV DNN y benchmarks.
★ 1046+7Variación de estrellas de los últimos 7 días - #85
TorchBench es una colección de benchmarks de código abierto utilizados para evaluar el rendimiento de PyTorch.
★ 1042-2Variación de estrellas de los últimos 7 días - #86
Suite de pruebas de rendimiento para Python.
★ 1029+1Variación de estrellas de los últimos 7 días - #87★ 1023+2Variación de estrellas de los últimos 7 días
- #88
Informe de realización de capacidades de DeepSeek V4 × J-Space: evidencia de benchmark de que J-Space reduce la pérdida de realización de capacidades en DeepSeek V4 (Flash/Pro).
★ 1021-4Variación de estrellas de los últimos 7 días - #89
Airspeed Velocity: Una sencilla herramienta de benchmarking en Python con informes basados en web
★ 1018+3Variación de estrellas de los últimos 7 días - #90
Molecular Sets (MOSES): Una plataforma de evaluación comparativa para modelos de generación molecular
★ 988+1Variación de estrellas de los últimos 7 días