benchmark
Repositorios de código abierto monitorizados etiquetados con benchmark, ordenados por estrellas.
- #121
Conjunto de código de detección y localización de objetos pequeños basado en puntos de UCAS-VG
★ 694+0Variación de estrellas de los últimos 7 días - #122
Evaluación comparativa de la veracidad en textos largos para modelos de lenguaje extensos. Código original para nuestro artículo "Long-form factuality in large language models".
★ 693+2Variación de estrellas de los últimos 7 días - #123
Un framework de benchmarking para el lenguaje Julia.
★ 683+1Variación de estrellas de los últimos 7 días - #124
Este repositorio contiene el código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] y "MMEB-V3" [COLM 2026].
★ 682+2Variación de estrellas de los últimos 7 días - #125
CAIRI: Caja de herramientas y benchmark para aprendizaje de representación visual supervisado, semi-supervisado y auto-supervisado
★ 658+0Variación de estrellas de los últimos 7 días - #126
Benchmark de código abierto para agentes de IA en navegadores para tareas diarias.
★ 657+40Variación de estrellas de los últimos 7 días - #127
Awesome-LLM-Eval: una lista curada de herramientas, conjuntos de datos/benchmarks, demos, tablas de clasificación, artículos, documentación y modelos, enfocada principalmente en la evaluación de LLMs.
★ 656-2Variación de estrellas de los últimos 7 días - #128
BenchMARL es una biblioteca para realizar evaluaciones comparativas de aprendizaje por refuerzo multiagente (MARL). BenchMARL permite comparar rápidamente diferentes algoritmos, tareas y modelos de MARL, basándose sistemáticamente en sus dos principios fundamentales: reproducibilidad y estandarización.
★ 656+0Variación de estrellas de los últimos 7 días - #129
A.S.E (AICGSecEval) es un benchmark de evaluación de seguridad de código generado por IA a nivel de repositorio, desarrollado por el equipo de seguridad de código Tencent Wukong.
★ 655+2Variación de estrellas de los últimos 7 días - #130
Un repositorio de conjuntos de datos interesantes recopilados para la investigación en ciencia de redes y aprendizaje automático.
★ 655+0Variación de estrellas de los últimos 7 días - #131
El primer benchmark de procesamiento de lenguaje natural a gran escala para el idioma indonesio. Proporcionamos múltiples tareas posteriores, modelos IndoBERT preentrenados y código de inicio (AACL-IJCNLP 2020)
★ 655+1Variación de estrellas de los últimos 7 días - #132
Kit de herramientas de benchmarking multiplataforma para Kotlin
★ 644+0Variación de estrellas de los últimos 7 días - #133★ 632+2Variación de estrellas de los últimos 7 días
- #134
AgentLab: un framework de código abierto para desarrollar, probar y evaluar agentes web en diversas tareas, diseñado para la escalabilidad y la reproducibilidad.
★ 628+0Variación de estrellas de los últimos 7 días - #135
Matchers de pruebas de rendimiento para RSpec.
★ 618+0Variación de estrellas de los últimos 7 días - #136
Benchmark de aprendizaje federado - Aprendizaje federado en silos de datos no IID: un estudio experimental (ICDE 2022)
★ 618+0Variación de estrellas de los últimos 7 días - #137
Un benchmark de clasificación de texto en PyTorch.
★ 608+0Variación de estrellas de los últimos 7 días - #138★ 604+0Variación de estrellas de los últimos 7 días
- #139
Una red global de sondas para ejecutar pruebas de red como ping, traceroute y resolución de DNS
★ 597+3Variación de estrellas de los últimos 7 días - #140
Seguimiento visual de objetos.
★ 596+2Variación de estrellas de los últimos 7 días - #141
Un evaluador de rendimiento de frameworks HTTP más moderno que soporta benchmarks de HTTP/1 y HTTP/2.
★ 588+1Variación de estrellas de los últimos 7 días - #142★ 580+2Variación de estrellas de los últimos 7 días
- #143
ParseBench: un benchmark de análisis de documentos para agentes de IA
★ 563+6Variación de estrellas de los últimos 7 días - #144
Biblioteca de serialización escrita en C++17: empaqueta estructuras de C++ en una matriz de bytes compacta sin macros ni código repetitivo.
★ 560+0Variación de estrellas de los últimos 7 días - #145
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 559—Variación de estrellas de los últimos 7 días - #146
Comparación de rendimiento básica de varios lenguajes de programación (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)
★ 557+0Variación de estrellas de los últimos 7 días - #147
SpeechIO Leaderboard: una plataforma de evaluación comparativa amplia, robusta y completa para el reconocimiento automático de voz.
★ 553+3Variación de estrellas de los últimos 7 días - #148
Meta Agents Research Environments es una plataforma integral diseñada para evaluar agentes de IA en escenarios dinámicos y realistas. A diferencia de los benchmarks estáticos, esta plataforma introduce entornos en evolución donde los agentes deben adaptar sus estrategias a medida que hay nueva información disponible, reflejando desafíos del mundo real.
★ 550+3Variación de estrellas de los últimos 7 días - #149
Conjunto de datos y benchmark para RAG en documentos internos de empresas.
★ 542+9Variación de estrellas de los últimos 7 días - #150★ 540+0Variación de estrellas de los últimos 7 días