benchmark
Dépôts open source suivis étiquetés benchmark, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de benchmark sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés benchmark.
- #1
Rapport de réalisation des capacités DeepSeek V4 × J-Space — preuve par benchmark que J-Space réduit la perte de réalisation des capacités sur DeepSeek V4.
★ 1 034 - #2
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #3
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1★ 28 759+60Évolution des étoiles sur les 7 derniers jours
- #2
Bibliothèque .NET puissante pour le benchmarking.
★ 11 485+6Évolution des étoiles sur les 7 derniers jours - #3★ 10 517+17Évolution des étoiles sur les 7 derniers jours
- #4★ 10 375+13Évolution des étoiles sur les 7 derniers jours
- #5★ 7 860+20Évolution des étoiles sur les 7 derniers jours
- #6
OpenCompass est une plateforme d'évaluation LLM, prenant en charge une large gamme de modèles (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, etc.) sur plus de 100 jeux de données.
★ 7 374+48Évolution des étoiles sur les 7 derniers jours - #7
Projet d'évaluation de serveurs VPS. La version Go sans dépendances d'environnement est recommandée : https://github.com/oneclickvirt/ecs
★ 7 155+16Évolution des étoiles sur les 7 derniers jours - #8
Quel est le framework web le plus rapide ?
★ 7 085-1Évolution des étoiles sur les 7 derniers jours - #9★ 6 782+3Évolution des étoiles sur les 7 derniers jours
- #10
YABS - un script bash simple pour évaluer les performances d'un serveur Linux via fio, iperf3 et Geekbench.
★ 6 654+20Évolution des étoiles sur les 7 derniers jours - #11
SWE-bench : les modèles de langage peuvent-ils résoudre des problèmes GitHub réels ?
★ 5 734+54Évolution des étoiles sur les 7 derniers jours - #12
Benchmarks de bibliothèques de recherche du plus proche voisin approximatif en Python.
★ 5 720+5Évolution des étoiles sur les 7 derniers jours - #13★ 5 601+5Évolution des étoiles sur les 7 derniers jours
- #14
Bibliothèque de benchmarking basée sur les statistiques pour Rust.
★ 5 523+5Évolution des étoiles sur les 7 derniers jours - #15★ 5 370+2Évolution des étoiles sur les 7 derniers jours
- #16
Logiciel de CFD basé sur la méthode de Boltzmann sur réseau, le plus rapide et efficace en mémoire, fonctionnant sur tous les GPU et CPU via OpenCL. Gratuit pour un usage non commercial.
★ 5 254+13Évolution des étoiles sur les 7 derniers jours - #17
Boîte à outils et benchmark de nouvelle génération pour la compréhension vidéo d'OpenMMLab
★ 5 147+5Évolution des étoiles sur les 7 derniers jours - #18
Kodezi Chronos est un modèle de langage axé sur le débogage, atteignant des résultats de pointe sur SWE-bench Lite (80,33 %) et une précision de correction réelle de 67 %, soit six fois mieux que GPT-4. Conçu avec Adaptive Graph-Guided Retrieval et Persistent Debug Memory. Modèle disponible au T1 2026 via Kodezi OS.
★ 4 928+12Évolution des étoiles sur les 7 derniers jours - #19
Boîte à outils d'évaluation multimodale tout-en-un pour les tâches textuelles, d'image, vidéo et audio.
★ 4 383+11Évolution des étoiles sur les 7 derniers jours - #20★ 4 310+7Évolution des étoiles sur les 7 derniers jours
- #21
Benchmark d'évaluation de la compréhension du langage chinois : jeux de données, lignes de base, modèles pré-entraînés, corpus et classement.
★ 4 279+0Évolution des étoiles sur les 7 derniers jours - #22★ 4 211-1Évolution des étoiles sur les 7 derniers jours
- #23
Une série de grands modèles de langage développés par Baichuan Intelligent Technology
★ 4 083-1Évolution des étoiles sur les 7 derniers jours - #24
Outils de benchmark HTTP(S), tests/débogage et restAPI (RESTful)
★ 3 767+3Évolution des étoiles sur les 7 derniers jours - #25
XcodeBenchmark mesure le temps de compilation d'une large base de code sur iMac, MacBook et Mac Pro.
★ 3 663+4Évolution des étoiles sur les 7 derniers jours - #26
⚡FlashRAG : Une boîte à outils Python pour la recherche efficace en RAG (Ressource WWW2025)
★ 3 562+13Évolution des étoiles sur les 7 derniers jours - #27
MTEB : Évaluation de pointe des embeddings à travers les langues et les modalités
★ 3 409+9Évolution des étoiles sur les 7 derniers jours - #28
Le logiciel open-source et multiplateforme de test et de benchmarking automatisé Phoronix Test Suite.
★ 3 118+5Évolution des étoiles sur les 7 derniers jours - #29
[NeurIPS 2024] OSWorld : évaluation comparative d'agents multimodaux pour des tâches ouvertes dans des environnements informatiques réels.
★ 3 112+11Évolution des étoiles sur les 7 derniers jours - #30
Projets sur les nombres premiers dans plus de 100 langages de programmation, pour comparer leur vitesse et l'ingéniosité des développeurs.
★ 3 016-1Évolution des étoiles sur les 7 derniers jours