benchmark
Repositorios de código abierto monitorizados etiquetados con benchmark, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a benchmark en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con benchmark.
- #1
Informe de realización de capacidades de DeepSeek V4 × J-Space: evidencia de benchmark de que J-Space reduce la pérdida de realización de capacidades en DeepSeek V4 (Flash/Pro).
★ 1035 - #2
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #3
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1★ 28.759+60Variación de estrellas de los últimos 7 días
- #2
Potente biblioteca .NET para pruebas de rendimiento
★ 11.485+6Variación de estrellas de los últimos 7 días - #3★ 10.517+17Variación de estrellas de los últimos 7 días
- #4★ 10.375+13Variación de estrellas de los últimos 7 días
- #5★ 7860+20Variación de estrellas de los últimos 7 días
- #6
OpenCompass es una plataforma de evaluación de LLM, que admite una amplia gama de modelos (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, etc.) en más de 100 conjuntos de datos.
★ 7374+48Variación de estrellas de los últimos 7 días - #7
Proyecto de evaluación de servidores VPS Fusion Monster. Se recomienda utilizar la versión en Go sin dependencias de entorno: https://github.com/oneclickvirt/ecs
★ 7155+16Variación de estrellas de los últimos 7 días - #8
¿Cuál es el framework web más rápido?
★ 7085-1Variación de estrellas de los últimos 7 días - #9★ 6782+3Variación de estrellas de los últimos 7 días
- #10
YABS - Un script de bash simple para estimar el rendimiento de un servidor Linux usando fio, iperf3 y Geekbench
★ 6654+20Variación de estrellas de los últimos 7 días - #11★ 5734+54Variación de estrellas de los últimos 7 días
- #12
Benchmarks de librerías de vecinos más cercanos aproximados en Python.
★ 5720+5Variación de estrellas de los últimos 7 días - #13★ 5601+5Variación de estrellas de los últimos 7 días
- #14
Biblioteca de benchmarking basada en estadísticas para Rust
★ 5523+5Variación de estrellas de los últimos 7 días - #15★ 5370+2Variación de estrellas de los últimos 7 días
- #16
El software CFD de celosía de Boltzmann más rápido y eficiente en memoria, que se ejecuta en todas las GPU y CPU mediante OpenCL. Gratuito para uso no comercial.
★ 5254+13Variación de estrellas de los últimos 7 días - #17
Caja de herramientas y banco de pruebas de próxima generación para la comprensión de video de OpenMMLab
★ 5147+5Variación de estrellas de los últimos 7 días - #18
Kodezi Chronos es un modelo de lenguaje centrado en la depuración que logra resultados de vanguardia en SWE-bench Lite (80.33%) y un 67% de precisión en correcciones del mundo real, más de seis veces mejor que GPT-4. Construido con Recuperación Guiada por Grafos Adaptativos y Memoria de Depuración Persistente. Modelo disponible en el primer trimestre de 2026 a través de Kodezi OS.
★ 4928+12Variación de estrellas de los últimos 7 días - #19
Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio
★ 4383+11Variación de estrellas de los últimos 7 días - #20★ 4310+7Variación de estrellas de los últimos 7 días
- #21
Evaluación comparativa de comprensión del idioma chino (Chinese Language Understanding Evaluation Benchmark): conjuntos de datos, líneas de base, modelos preentrenados, corpus y tabla de clasificación
★ 4279+0Variación de estrellas de los últimos 7 días - #22★ 4211-1Variación de estrellas de los últimos 7 días
- #23
Una serie de modelos de lenguaje grandes desarrollados por Baichuan Intelligent Technology
★ 4083-1Variación de estrellas de los últimos 7 días - #24
Herramientas de evaluación comparativa HTTP(S), pruebas/depuración y API REST (RESTful)
★ 3767+3Variación de estrellas de los últimos 7 días - #25
XcodeBenchmark mide el tiempo de compilación de una base de código grande en iMac, MacBook y Mac Pro
★ 3663+4Variación de estrellas de los últimos 7 días - #26
⚡FlashRAG: Un kit de herramientas en Python para la investigación eficiente de RAG (Recurso WWW2025)
★ 3562+13Variación de estrellas de los últimos 7 días - #27
MTEB: Evaluación de vanguardia de incrustaciones en varios idiomas y modalidades.
★ 3409+9Variación de estrellas de los últimos 7 días - #28
Software de pruebas y benchmarking automatizado, multiplataforma y de código abierto Phoronix Test Suite.
★ 3118+5Variación de estrellas de los últimos 7 días - #29
[NeurIPS 2024] OSWorld: Evaluación comparativa de agentes multimodales para tareas abiertas en entornos informáticos reales
★ 3112+11Variación de estrellas de los últimos 7 días - #30
Proyectos de números primos en más de 100 lenguajes de programación, para comparar su velocidad y el ingenio de sus programadores
★ 3016-1Variación de estrellas de los últimos 7 días