Pular para o conteúdo principal
buildradar
Sign in
Tópico · benchmark

benchmark

Repositórios de código aberto acompanhados marcados com benchmark, ordenados por estrelas.

158 repositórios
  • PointTinyBenchmark@ucas-vg

    Conjunto de código de detecção e localização de objetos pequenos e baseados em pontos da UCAS-VG

    694+0Variação de estrelas nos últimos 7 dias
  • long-form-factuality@google-deepmind

    Benchmarking de factualidade de formato longo em grandes modelos de linguagem. Código original para nosso artigo "Long-form factuality in large language models".

    693+2Variação de estrelas nos últimos 7 dias
  • Um framework de benchmark para a linguagem Julia

    683+1Variação de estrelas nos últimos 7 dias
  • VLM2Vec@TIGER-AI-Lab

    Este repositório contém o código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] e "MMEB-V3" [COLM 2026].

    682+2Variação de estrelas nos últimos 7 dias
  • openmixup@Westlake-AI

    Caixa de ferramentas e benchmark de aprendizado de representação visual supervisionado, semi-supervisionado e auto-supervisionado do CAIRI

    658+0Variação de estrelas nos últimos 7 dias
  • ClawBench@TIGER-AI-Lab

    Benchmark de código aberto para agentes de IA de navegador em tarefas diárias.

    657+40Variação de estrelas nos últimos 7 dias
  • Awesome-LLM-Eval: uma lista com curadoria de ferramentas, conjuntos de dados/benchmarks, demonstrações, placares, artigos, documentos e modelos, focada principalmente na avaliação de LLMs.

    656-2Variação de estrelas nos últimos 7 dias
  • BenchMARL@facebookresearch

    BenchMARL é uma biblioteca para benchmark de Multi-Agent Reinforcement Learning (MARL). O BenchMARL permite comparar rapidamente diferentes algoritmos, tarefas e modelos de MARL, mantendo-se sistematicamente fundamentado em seus dois principais pilares: reprodutibilidade e padronização.

    656+0Variação de estrelas nos últimos 7 dias
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) é um benchmark de avaliação de segurança de código gerado por IA em nível de repositório, desenvolvido pela equipe Tencent Wukong Code Security.

    655+2Variação de estrelas nos últimos 7 dias
  • datasets@benedekrozemberczki

    Um repositório de conjuntos de dados bem legais que coletei para pesquisas em ciência de redes e aprendizado de máquina.

    655+0Variação de estrelas nos últimos 7 dias
  • indonlu@IndoNLP

    O primeiro e maior benchmark de processamento de linguagem natural para a língua indonésia. Fornecemos múltiplas tarefas de downstream, modelos IndoBERT pré-treinados e código inicial! (AACL-IJCNLP 2020)

    655+1Variação de estrelas nos últimos 7 dias
  • Kit de ferramentas de benchmarking multiplataforma para Kotlin

    644+0Variação de estrelas nos últimos 7 dias
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Confiabilidade em Modelos de Linguagem Grandes

    632+2Variação de estrelas nos últimos 7 dias
  • AgentLab@ServiceNow

    AgentLab: Um framework open-source para desenvolver, testar e avaliar agentes web em diversas tarefas, projetado para escalabilidade e reprodutibilidade.

    628+0Variação de estrelas nos últimos 7 dias
  • rspec-benchmark@piotrmurach

    Matchers de teste de desempenho para RSpec

    618+0Variação de estrelas nos últimos 7 dias
  • NIID-Bench@Xtra-Computing

    Benchmark de Aprendizado Federado - Aprendizado Federado em Silos de Dados Não-IID: Um Estudo Experimental (ICDE 2022)

    618+0Variação de estrelas nos últimos 7 dias
  • TextClassificationBenchmark@FreedomIntelligence

    Um benchmark de classificação de texto em PyTorch

    608+0Variação de estrelas nos últimos 7 dias
  • KLUE@KLUE-benchmark

    📖 Benchmark de NLU em Coreano

    604+0Variação de estrelas nos últimos 7 dias
  • globalping@jsdelivr

    Uma rede global de sondas para executar testes de rede como ping, traceroute e resolução de DNS.

    597+3Variação de estrelas nos últimos 7 dias
  • Rastreamento Visual de Objetos

    596+2Variação de estrelas nos últimos 7 dias
  • rewrk@lnx-search

    Um benchmark de framework HTTP mais moderno, com suporte a benchmarks de HTTP/1 e HTTP/2.

    588+1Variação de estrelas nos últimos 7 dias
  • CL-bench@Tencent-Hunyuan

    CL-bench: Um Benchmark para Context Learning

    580+2Variação de estrelas nos últimos 7 dias
  • ParseBench@run-llama

    ParseBench - Um benchmark de análise de documentos para agentes de IA

    563+6Variação de estrelas nos últimos 7 dias
  • alpaca@p-ranav

    Biblioteca de serialização escrita em C++17 - Empacota structs de C++ em um array de bytes compacto sem macros ou código boilerplate

    560+0Variação de estrelas nos últimos 7 dias
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    559Variação de estrelas nos últimos 7 dias
  • Comparação simples de desempenho de algumas linguagens de programação (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)

    557+0Variação de estrelas nos últimos 7 dias
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: uma plataforma de benchmarking ampla, robusta e abrangente para Reconhecimento Automático de Fala (ASR).

    553+3Variação de estrelas nos últimos 7 dias
  • Meta Agents Research Environments é uma plataforma abrangente projetada para avaliar agentes de IA em cenários dinâmicos e realistas. Ao contrário de benchmarks estáticos, esta plataforma introduz ambientes em evolução onde os agentes devem adaptar suas estratégias à medida que novas informações se tornam disponíveis, espelhando os desafios do mundo real.

    550+3Variação de estrelas nos últimos 7 dias
  • Dataset e benchmark para RAG em documentos internos de empresas.

    542+9Variação de estrelas nos últimos 7 dias
  • NBench@petabridge

    Framework de benchmarking e teste de desempenho para aplicações .NET

    540+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos