benchmark
Dépôts open source suivis étiquetés benchmark, triés par étoiles.
- #61
Évaluez les LLM en les faisant combattre dans Street Fighter 3 ! La nouvelle façon d'évaluer la qualité d'un LLM
★ 1 483+0Évolution des étoiles sur les 7 derniers jours - #62
Fixture pytest pour l'analyse comparative de code
★ 1 448+0Évolution des étoiles sur les 7 derniers jours - #63★ 1 444+1Évolution des étoiles sur les 7 derniers jours
- #64
[pip install medmnist] 18 jeux de données standardisés pour la classification d'images biomédicales 2D et 3D.
★ 1 399+0Évolution des étoiles sur les 7 derniers jours - #65
Compilateur rapide pour les arbres d'expression C# et alternative légère LightExpression. Outils de diagnostic et de génération de code pour les expressions.
★ 1 375+1Évolution des étoiles sur les 7 derniers jours - #66★ 1 367+1Évolution des étoiles sur les 7 derniers jours
- #67
Framework modulaire d'apprentissage par renforcement profond en PyTorch. Bibliothèque compagnon du livre "Foundations of Deep Reinforcement Learning".
★ 1 362+0Évolution des étoiles sur les 7 derniers jours - #68
Dernières avancées sur le raisonnement de type System-2.
★ 1 353+0Évolution des étoiles sur les 7 derniers jours - #69
[NeurIPS '25] Génération de graphes de connaissances à partir de n'importe quel texte
★ 1 266+6Évolution des étoiles sur les 7 derniers jours - #70
GitHub Action pour le benchmarking continu afin de maintenir les performances.
★ 1 251+0Évolution des étoiles sur les 7 derniers jours - #71★ 1 237+0Évolution des étoiles sur les 7 derniers jours
- #72★ 1 232+1Évolution des étoiles sur les 7 derniers jours
- #73
KernelBench : Les LLM peuvent-ils écrire des noyaux GPU ? - Benchmark et boîte à outils avec Torch vers CUDA (et autres DSL)
★ 1 227+7Évolution des étoiles sur les 7 derniers jours - #74★ 1 192+0Évolution des étoiles sur les 7 derniers jours
- #75
Compilation de scripts de benchmarking pour serveurs Linux.
★ 1 190+0Évolution des étoiles sur les 7 derniers jours - #76★ 1 188+0Évolution des étoiles sur les 7 derniers jours
- #77
Benchmark pour bases de données vectorielles.
★ 1 173+2Évolution des étoiles sur les 7 derniers jours - #78
JMLR : OmniSafe est un framework infrastructurel destiné à accélérer la recherche en SafeRL.
★ 1 150+1Évolution des étoiles sur les 7 derniers jours - #79★ 1 143+5Évolution des étoiles sur les 7 derniers jours
- #80
Générateur rapide de nombres premiers
★ 1 114+1Évolution des étoiles sur les 7 derniers jours - #81
ClickBench : un benchmark pour les bases de données analytiques
★ 1 094+2Évolution des étoiles sur les 7 derniers jours - #82★ 1 083+4Évolution des étoiles sur les 7 derniers jours
- #83
Outil de génération de trafic et de benchmarking pour NoSQL, Redis et Memcache.
★ 1 053+5Évolution des étoiles sur les 7 derniers jours - #84
Zoo de modèles et benchmarks pour OpenCV DNN.
★ 1 046+8Évolution des étoiles sur les 7 derniers jours - #85
TorchBench est une collection de benchmarks open source utilisés pour évaluer les performances de PyTorch.
★ 1 042-1Évolution des étoiles sur les 7 derniers jours - #86
Suite de tests de performance pour Python
★ 1 029+1Évolution des étoiles sur les 7 derniers jours - #87
Rapport de réalisation des capacités DeepSeek V4 × J-Space — preuve par benchmark que J-Space réduit la perte de réalisation des capacités sur DeepSeek V4.
★ 1 023-11Évolution des étoiles sur les 7 derniers jours - #88★ 1 023+2Évolution des étoiles sur les 7 derniers jours
- #89
Airspeed Velocity : Un outil de benchmarking Python simple avec rapports sur le web
★ 1 018+4Évolution des étoiles sur les 7 derniers jours - #90
Molecular Sets (MOSES) : une plateforme d'évaluation pour les modèles de génération moléculaire
★ 988+0Évolution des étoiles sur les 7 derniers jours