benchmark
Repositórios de código aberto acompanhados marcados com benchmark, ordenados por estrelas.
- #121
Conjunto de código de detecção e localização de objetos pequenos e baseados em pontos da UCAS-VG
★ 694+0Variação de estrelas nos últimos 7 dias - #122
Benchmarking de factualidade de formato longo em grandes modelos de linguagem. Código original para nosso artigo "Long-form factuality in large language models".
★ 693+2Variação de estrelas nos últimos 7 dias - #123
Um framework de benchmark para a linguagem Julia
★ 683+1Variação de estrelas nos últimos 7 dias - #124
Este repositório contém o código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] e "MMEB-V3" [COLM 2026].
★ 682+2Variação de estrelas nos últimos 7 dias - #125
Caixa de ferramentas e benchmark de aprendizado de representação visual supervisionado, semi-supervisionado e auto-supervisionado do CAIRI
★ 658+0Variação de estrelas nos últimos 7 dias - #126
Benchmark de código aberto para agentes de IA de navegador em tarefas diárias.
★ 657+40Variação de estrelas nos últimos 7 dias - #127
Awesome-LLM-Eval: uma lista com curadoria de ferramentas, conjuntos de dados/benchmarks, demonstrações, placares, artigos, documentos e modelos, focada principalmente na avaliação de LLMs.
★ 656-2Variação de estrelas nos últimos 7 dias - #128
BenchMARL é uma biblioteca para benchmark de Multi-Agent Reinforcement Learning (MARL). O BenchMARL permite comparar rapidamente diferentes algoritmos, tarefas e modelos de MARL, mantendo-se sistematicamente fundamentado em seus dois principais pilares: reprodutibilidade e padronização.
★ 656+0Variação de estrelas nos últimos 7 dias - #129
A.S.E (AICGSecEval) é um benchmark de avaliação de segurança de código gerado por IA em nível de repositório, desenvolvido pela equipe Tencent Wukong Code Security.
★ 655+2Variação de estrelas nos últimos 7 dias - #130
Um repositório de conjuntos de dados bem legais que coletei para pesquisas em ciência de redes e aprendizado de máquina.
★ 655+0Variação de estrelas nos últimos 7 dias - #131
O primeiro e maior benchmark de processamento de linguagem natural para a língua indonésia. Fornecemos múltiplas tarefas de downstream, modelos IndoBERT pré-treinados e código inicial! (AACL-IJCNLP 2020)
★ 655+1Variação de estrelas nos últimos 7 dias - #132
Kit de ferramentas de benchmarking multiplataforma para Kotlin
★ 644+0Variação de estrelas nos últimos 7 dias - #133★ 632+2Variação de estrelas nos últimos 7 dias
- #134
AgentLab: Um framework open-source para desenvolver, testar e avaliar agentes web em diversas tarefas, projetado para escalabilidade e reprodutibilidade.
★ 628+0Variação de estrelas nos últimos 7 dias - #135
Matchers de teste de desempenho para RSpec
★ 618+0Variação de estrelas nos últimos 7 dias - #136
Benchmark de Aprendizado Federado - Aprendizado Federado em Silos de Dados Não-IID: Um Estudo Experimental (ICDE 2022)
★ 618+0Variação de estrelas nos últimos 7 dias - #137
Um benchmark de classificação de texto em PyTorch
★ 608+0Variação de estrelas nos últimos 7 dias - #138★ 604+0Variação de estrelas nos últimos 7 dias
- #139
Uma rede global de sondas para executar testes de rede como ping, traceroute e resolução de DNS.
★ 597+3Variação de estrelas nos últimos 7 dias - #140
Rastreamento Visual de Objetos
★ 596+2Variação de estrelas nos últimos 7 dias - #141
Um benchmark de framework HTTP mais moderno, com suporte a benchmarks de HTTP/1 e HTTP/2.
★ 588+1Variação de estrelas nos últimos 7 dias - #142★ 580+2Variação de estrelas nos últimos 7 dias
- #143
ParseBench - Um benchmark de análise de documentos para agentes de IA
★ 563+6Variação de estrelas nos últimos 7 dias - #144
Biblioteca de serialização escrita em C++17 - Empacota structs de C++ em um array de bytes compacto sem macros ou código boilerplate
★ 560+0Variação de estrelas nos últimos 7 dias - #145
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 559—Variação de estrelas nos últimos 7 dias - #146
Comparação simples de desempenho de algumas linguagens de programação (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)
★ 557+0Variação de estrelas nos últimos 7 dias - #147
SpeechIO Leaderboard: uma plataforma de benchmarking ampla, robusta e abrangente para Reconhecimento Automático de Fala (ASR).
★ 553+3Variação de estrelas nos últimos 7 dias - #148
Meta Agents Research Environments é uma plataforma abrangente projetada para avaliar agentes de IA em cenários dinâmicos e realistas. Ao contrário de benchmarks estáticos, esta plataforma introduz ambientes em evolução onde os agentes devem adaptar suas estratégias à medida que novas informações se tornam disponíveis, espelhando os desafios do mundo real.
★ 550+3Variação de estrelas nos últimos 7 dias - #149
Dataset e benchmark para RAG em documentos internos de empresas.
★ 542+9Variação de estrelas nos últimos 7 dias - #150★ 540+0Variação de estrelas nos últimos 7 dias