Saltar al contenido principal
buildradar
Sign in
Tema · benchmark

benchmark

Repositorios de código abierto monitorizados etiquetados con benchmark, ordenados por estrellas.

158 repositorios
  • PointTinyBenchmark@ucas-vg

    Conjunto de código de detección y localización de objetos pequeños basado en puntos de UCAS-VG

    694+0Variación de estrellas de los últimos 7 días
  • long-form-factuality@google-deepmind

    Evaluación comparativa de la veracidad en textos largos para modelos de lenguaje extensos. Código original para nuestro artículo "Long-form factuality in large language models".

    693+2Variación de estrellas de los últimos 7 días
  • Un framework de benchmarking para el lenguaje Julia.

    683+1Variación de estrellas de los últimos 7 días
  • VLM2Vec@TIGER-AI-Lab

    Este repositorio contiene el código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] y "MMEB-V3" [COLM 2026].

    682+2Variación de estrellas de los últimos 7 días
  • openmixup@Westlake-AI

    CAIRI: Caja de herramientas y benchmark para aprendizaje de representación visual supervisado, semi-supervisado y auto-supervisado

    658+0Variación de estrellas de los últimos 7 días
  • ClawBench@TIGER-AI-Lab

    Benchmark de código abierto para agentes de IA en navegadores para tareas diarias.

    657+40Variación de estrellas de los últimos 7 días
  • Awesome-LLM-Eval: una lista curada de herramientas, conjuntos de datos/benchmarks, demos, tablas de clasificación, artículos, documentación y modelos, enfocada principalmente en la evaluación de LLMs.

    656-2Variación de estrellas de los últimos 7 días
  • BenchMARL@facebookresearch

    BenchMARL es una biblioteca para realizar evaluaciones comparativas de aprendizaje por refuerzo multiagente (MARL). BenchMARL permite comparar rápidamente diferentes algoritmos, tareas y modelos de MARL, basándose sistemáticamente en sus dos principios fundamentales: reproducibilidad y estandarización.

    656+0Variación de estrellas de los últimos 7 días
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) es un benchmark de evaluación de seguridad de código generado por IA a nivel de repositorio, desarrollado por el equipo de seguridad de código Tencent Wukong.

    655+2Variación de estrellas de los últimos 7 días
  • datasets@benedekrozemberczki

    Un repositorio de conjuntos de datos interesantes recopilados para la investigación en ciencia de redes y aprendizaje automático.

    655+0Variación de estrellas de los últimos 7 días
  • indonlu@IndoNLP

    El primer benchmark de procesamiento de lenguaje natural a gran escala para el idioma indonesio. Proporcionamos múltiples tareas posteriores, modelos IndoBERT preentrenados y código de inicio (AACL-IJCNLP 2020)

    655+1Variación de estrellas de los últimos 7 días
  • Kit de herramientas de benchmarking multiplataforma para Kotlin

    644+0Variación de estrellas de los últimos 7 días
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Confiabilidad en modelos de lenguaje de gran tamaño.

    632+2Variación de estrellas de los últimos 7 días
  • AgentLab@ServiceNow

    AgentLab: un framework de código abierto para desarrollar, probar y evaluar agentes web en diversas tareas, diseñado para la escalabilidad y la reproducibilidad.

    628+0Variación de estrellas de los últimos 7 días
  • rspec-benchmark@piotrmurach

    Matchers de pruebas de rendimiento para RSpec.

    618+0Variación de estrellas de los últimos 7 días
  • NIID-Bench@Xtra-Computing

    Benchmark de aprendizaje federado - Aprendizaje federado en silos de datos no IID: un estudio experimental (ICDE 2022)

    618+0Variación de estrellas de los últimos 7 días
  • TextClassificationBenchmark@FreedomIntelligence

    Un benchmark de clasificación de texto en PyTorch.

    608+0Variación de estrellas de los últimos 7 días
  • KLUE@KLUE-benchmark

    📖 Benchmark de NLU en coreano

    604+0Variación de estrellas de los últimos 7 días
  • globalping@jsdelivr

    Una red global de sondas para ejecutar pruebas de red como ping, traceroute y resolución de DNS

    597+3Variación de estrellas de los últimos 7 días
  • Seguimiento visual de objetos.

    596+2Variación de estrellas de los últimos 7 días
  • rewrk@lnx-search

    Un evaluador de rendimiento de frameworks HTTP más moderno que soporta benchmarks de HTTP/1 y HTTP/2.

    588+1Variación de estrellas de los últimos 7 días
  • CL-bench@Tencent-Hunyuan

    CL-bench: un benchmark para aprendizaje en contexto

    580+2Variación de estrellas de los últimos 7 días
  • ParseBench@run-llama

    ParseBench: un benchmark de análisis de documentos para agentes de IA

    563+6Variación de estrellas de los últimos 7 días
  • alpaca@p-ranav

    Biblioteca de serialización escrita en C++17: empaqueta estructuras de C++ en una matriz de bytes compacta sin macros ni código repetitivo.

    560+0Variación de estrellas de los últimos 7 días
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    559Variación de estrellas de los últimos 7 días
  • Comparación de rendimiento básica de varios lenguajes de programación (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)

    557+0Variación de estrellas de los últimos 7 días
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: una plataforma de evaluación comparativa amplia, robusta y completa para el reconocimiento automático de voz.

    553+3Variación de estrellas de los últimos 7 días
  • Meta Agents Research Environments es una plataforma integral diseñada para evaluar agentes de IA en escenarios dinámicos y realistas. A diferencia de los benchmarks estáticos, esta plataforma introduce entornos en evolución donde los agentes deben adaptar sus estrategias a medida que hay nueva información disponible, reflejando desafíos del mundo real.

    550+3Variación de estrellas de los últimos 7 días
  • Conjunto de datos y benchmark para RAG en documentos internos de empresas.

    542+9Variación de estrellas de los últimos 7 días
  • NBench@petabridge

    Marco de pruebas y evaluación comparativa de rendimiento para aplicaciones .NET.

    540+0Variación de estrellas de los últimos 7 días
← Volver a temas