Aller au contenu principal
buildradar
Sign in
Sujet · benchmark

benchmark

Dépôts open source suivis étiquetés benchmark, triés par étoiles.

158 dépôts
  • PointTinyBenchmark@ucas-vg

    Ensemble de code de détection et de localisation d'objets minuscules basés sur des points de UCAS-VG

    694+1Évolution des étoiles sur les 7 derniers jours
  • long-form-factuality@google-deepmind

    Évaluation comparative de la factualité à long format dans les grands modèles de langage. Code source original de notre article "Long-form factuality in large language models".

    693+2Évolution des étoiles sur les 7 derniers jours
  • Un framework de benchmarking pour le langage Julia.

    683+0Évolution des étoiles sur les 7 derniers jours
  • VLM2Vec@TIGER-AI-Lab

    Ce dépôt contient le code de "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], et "MMEB-V3" [COLM 2026]

    682+2Évolution des étoiles sur les 7 derniers jours
  • ClawBench@TIGER-AI-Lab

    Benchmark open source pour agents IA de navigateur sur des tâches quotidiennes.

    664+61Évolution des étoiles sur les 7 derniers jours
  • openmixup@Westlake-AI

    Boîte à outils et benchmark CAIRI pour l'apprentissage visuel supervisé, semi‑supervisé et non supervisé

    658+0Évolution des étoiles sur les 7 derniers jours
  • Awesome-LLM-Eval : une liste organisée d'outils, de jeux de données/benchmarks, de démos, de classements, d'articles, de documentation et de modèles, principalement dédiée à l'évaluation des LLM.

    656-2Évolution des étoiles sur les 7 derniers jours
  • BenchMARL@facebookresearch

    BenchMARL est une bibliothèque de benchmarking pour l'apprentissage par renforcement multi-agents (MARL). BenchMARL permet de comparer rapidement différents algorithmes MARL, tâches et modèles, tout en étant systématiquement fondé sur ses deux principes fondamentaux : la reproductibilité et la standardisation.

    656+2Évolution des étoiles sur les 7 derniers jours
  • indonlu@IndoNLP

    Le premier benchmark de traitement du langage naturel à grande échelle pour la langue Indonesian. Nous proposons plusieurs tâches en aval, des modèles IndoBERT pré-entraînés, et du code de démarrage! (AACL-IJCNLP 2020)

    655+1Évolution des étoiles sur les 7 derniers jours
  • datasets@benedekrozemberczki

    Un dépôt de jeux de données assez cool que j'ai collectés pour la recherche en science des réseaux et en apprentissage automatique.

    655+0Évolution des étoiles sur les 7 derniers jours
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) est un benchmark d'évaluation de la sécurité du code généré par IA au niveau du dépôt, développé par l'équipe Tencent Wukong Code Security.

    655+0Évolution des étoiles sur les 7 derniers jours
  • Boîte à outils de benchmarking multiplateforme Kotlin

    644+0Évolution des étoiles sur les 7 derniers jours
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM : La fiabilité dans les grands modèles de langage

    632+2Évolution des étoiles sur les 7 derniers jours
  • AgentLab@ServiceNow

    AgentLab : Cadre open-source de développement, de test et d'évaluation d'agents web sur des tâches variées, conçu pour la scalabilité et la reproductibilité.

    629+2Évolution des étoiles sur les 7 derniers jours
  • NIID-Bench@Xtra-Computing

    Benchmark d'Apprentissage Federé - Apprentissage fédéré sur des silos de données non‑IID : Une étude expérimentale (ICDE 2022)

    618+0Évolution des étoiles sur les 7 derniers jours
  • rspec-benchmark@piotrmurach

    Matchers de test de performance pour RSpec

    618+0Évolution des étoiles sur les 7 derniers jours
  • TextClassificationBenchmark@FreedomIntelligence

    Un benchmark de classification de texte en PyTorch

    608+0Évolution des étoiles sur les 7 derniers jours
  • KLUE@KLUE-benchmark

    📖 Benchmark NLU en coréen

    604+0Évolution des étoiles sur les 7 derniers jours
  • globalping@jsdelivr

    Un réseau mondial de sondes pour exécuter des tests réseau tels que le ping, le traceroute et la résolution DNS

    597+3Évolution des étoiles sur les 7 derniers jours
  • Suivi d'objets visuels

    596+1Évolution des étoiles sur les 7 derniers jours
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594Évolution des étoiles sur les 7 derniers jours
  • rewrk@lnx-search

    Un benchmark de frameworks HTTP plus moderne prenant en charge les benchmarks HTTP/1 et HTTP/2.

    588+2Évolution des étoiles sur les 7 derniers jours
  • CL-bench@Tencent-Hunyuan

    CL-bench : Un benchmark pour l'apprentissage contextuel

    580+1Évolution des étoiles sur les 7 derniers jours
  • ParseBench@run-llama

    ParseBench - Un benchmark d'analyse de documents pour les agents IA.

    565+12Évolution des étoiles sur les 7 derniers jours
  • alpaca@p-ranav

    Bibliothèque de sérialisation écrite en C++17 - Empaquette des structures C++ dans un tableau d'octets compact sans macros ni code boilerplate

    560+0Évolution des étoiles sur les 7 derniers jours
  • Comparaison naïve de performances de quelques langages de programmation (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)

    557+1Évolution des étoiles sur les 7 derniers jours
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard : une plateforme de benchmarking vaste, robuste et complète pour la reconnaissance automatique de la parole.

    553+3Évolution des étoiles sur les 7 derniers jours
  • Meta Agents Research Environments est une plateforme complète conçue pour évaluer les agents IA dans des scénarios dynamiques et réalistes. Contrairement aux benchmarks statiques, cette plateforme introduit des environnements évolutifs où les agents doivent adapter leurs stratégies à mesure que de nouvelles informations deviennent disponibles, reflétant les défis du monde réel.

    550+3Évolution des étoiles sur les 7 derniers jours
  • Jeu de données et benchmark pour le RAG sur des documents internes d'entreprise.

    545+11Évolution des étoiles sur les 7 derniers jours
  • NBench@petabridge

    Framework de benchmarking et de test de performance pour les applications .NET.

    540+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets