benchmark
Dépôts open source suivis étiquetés benchmark, triés par étoiles.
- #121
Ensemble de code de détection et de localisation d'objets minuscules basés sur des points de UCAS-VG
★ 694+1Évolution des étoiles sur les 7 derniers jours - #122
Évaluation comparative de la factualité à long format dans les grands modèles de langage. Code source original de notre article "Long-form factuality in large language models".
★ 693+2Évolution des étoiles sur les 7 derniers jours - #123
Un framework de benchmarking pour le langage Julia.
★ 683+0Évolution des étoiles sur les 7 derniers jours - #124
Ce dépôt contient le code de "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], et "MMEB-V3" [COLM 2026]
★ 682+2Évolution des étoiles sur les 7 derniers jours - #125
Benchmark open source pour agents IA de navigateur sur des tâches quotidiennes.
★ 664+61Évolution des étoiles sur les 7 derniers jours - #126
Boîte à outils et benchmark CAIRI pour l'apprentissage visuel supervisé, semi‑supervisé et non supervisé
★ 658+0Évolution des étoiles sur les 7 derniers jours - #127
Awesome-LLM-Eval : une liste organisée d'outils, de jeux de données/benchmarks, de démos, de classements, d'articles, de documentation et de modèles, principalement dédiée à l'évaluation des LLM.
★ 656-2Évolution des étoiles sur les 7 derniers jours - #128
BenchMARL est une bibliothèque de benchmarking pour l'apprentissage par renforcement multi-agents (MARL). BenchMARL permet de comparer rapidement différents algorithmes MARL, tâches et modèles, tout en étant systématiquement fondé sur ses deux principes fondamentaux : la reproductibilité et la standardisation.
★ 656+2Évolution des étoiles sur les 7 derniers jours - #129
Le premier benchmark de traitement du langage naturel à grande échelle pour la langue Indonesian. Nous proposons plusieurs tâches en aval, des modèles IndoBERT pré-entraînés, et du code de démarrage! (AACL-IJCNLP 2020)
★ 655+1Évolution des étoiles sur les 7 derniers jours - #130
Un dépôt de jeux de données assez cool que j'ai collectés pour la recherche en science des réseaux et en apprentissage automatique.
★ 655+0Évolution des étoiles sur les 7 derniers jours - #131
A.S.E (AICGSecEval) est un benchmark d'évaluation de la sécurité du code généré par IA au niveau du dépôt, développé par l'équipe Tencent Wukong Code Security.
★ 655+0Évolution des étoiles sur les 7 derniers jours - #132
Boîte à outils de benchmarking multiplateforme Kotlin
★ 644+0Évolution des étoiles sur les 7 derniers jours - #133★ 632+2Évolution des étoiles sur les 7 derniers jours
- #134
AgentLab : Cadre open-source de développement, de test et d'évaluation d'agents web sur des tâches variées, conçu pour la scalabilité et la reproductibilité.
★ 629+2Évolution des étoiles sur les 7 derniers jours - #135
Benchmark d'Apprentissage Federé - Apprentissage fédéré sur des silos de données non‑IID : Une étude expérimentale (ICDE 2022)
★ 618+0Évolution des étoiles sur les 7 derniers jours - #136
Matchers de test de performance pour RSpec
★ 618+0Évolution des étoiles sur les 7 derniers jours - #137
Un benchmark de classification de texte en PyTorch
★ 608+0Évolution des étoiles sur les 7 derniers jours - #138★ 604+0Évolution des étoiles sur les 7 derniers jours
- #139
Un réseau mondial de sondes pour exécuter des tests réseau tels que le ping, le traceroute et la résolution DNS
★ 597+3Évolution des étoiles sur les 7 derniers jours - #140
Suivi d'objets visuels
★ 596+1Évolution des étoiles sur les 7 derniers jours - #141
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594—Évolution des étoiles sur les 7 derniers jours - #142
Un benchmark de frameworks HTTP plus moderne prenant en charge les benchmarks HTTP/1 et HTTP/2.
★ 588+2Évolution des étoiles sur les 7 derniers jours - #143★ 580+1Évolution des étoiles sur les 7 derniers jours
- #144
ParseBench - Un benchmark d'analyse de documents pour les agents IA.
★ 565+12Évolution des étoiles sur les 7 derniers jours - #145
Bibliothèque de sérialisation écrite en C++17 - Empaquette des structures C++ dans un tableau d'octets compact sans macros ni code boilerplate
★ 560+0Évolution des étoiles sur les 7 derniers jours - #146
Comparaison naïve de performances de quelques langages de programmation (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)
★ 557+1Évolution des étoiles sur les 7 derniers jours - #147
SpeechIO Leaderboard : une plateforme de benchmarking vaste, robuste et complète pour la reconnaissance automatique de la parole.
★ 553+3Évolution des étoiles sur les 7 derniers jours - #148
Meta Agents Research Environments est une plateforme complète conçue pour évaluer les agents IA dans des scénarios dynamiques et réalistes. Contrairement aux benchmarks statiques, cette plateforme introduit des environnements évolutifs où les agents doivent adapter leurs stratégies à mesure que de nouvelles informations deviennent disponibles, reflétant les défis du monde réel.
★ 550+3Évolution des étoiles sur les 7 derniers jours - #149
Jeu de données et benchmark pour le RAG sur des documents internes d'entreprise.
★ 545+11Évolution des étoiles sur les 7 derniers jours - #150★ 540+0Évolution des étoiles sur les 7 derniers jours