evaluation
Dépôts open source suivis étiquetés evaluation, triés par étoiles.
- #31
Partage d'aperçus pratiques et de connaissances théoriques sur l'évaluation des LLM, recueillis lors de la gestion de l'Open LLM Leaderboard et de la conception de lighteval.
★ 2 143+2Évolution des étoiles sur les 7 derniers jours - #32
Avalanche : une bibliothèque de bout en bout pour l'apprentissage continu basée sur PyTorch.
★ 2 088+0Évolution des étoiles sur les 7 derniers jours - #33★ 2 037-2Évolution des étoiles sur les 7 derniers jours
- #34
Un évaluateur automatique pour les modèles de langage suivant des instructions. Validé par l'humain, de haute qualité, économique et rapide.
★ 2 012-1Évolution des étoiles sur les 7 derniers jours - #35
(IROS 2020, ECCVW 2020) Implémentation Python officielle pour « 3D Multi-Object Tracking: A Baseline and New Evaluation Metrics ».
★ 1 846+0Évolution des étoiles sur les 7 derniers jours - #36
WFGY se dirige vers le protocole WFGY 5.0 Polaris, une version open-source majeure pour le raisonnement IA, le RAG, les agents et les flux de travail réels. Inclut Problem Map, Global Debug Card, WFGY 4.0 et l'Easter Egg CFV.
★ 1 786+1Évolution des étoiles sur les 7 derniers jours - #37
Grand modèle de langage (LLM) pour la santé mentale, incluant pré-entraînement, post-entraînement, jeux de données, évaluation, déploiement et RAG, avec les séries de modèles InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama et GLM.
★ 1 781+1Évolution des étoiles sur les 7 derniers jours - #38
Un framework Go pour créer des systèmes d'agents en production avec workflows graphiques, outils, mémoire, A2A, AG-UI, MCP, évaluation et observabilité.
★ 1 760+12Évolution des étoiles sur les 7 derniers jours - #39★ 1 668+0Évolution des étoiles sur les 7 derniers jours
- #40
Page GitHub officielle de l'article de synthèse A Survey on Evaluation of Large Language Models
★ 1 608-1Évolution des étoiles sur les 7 derniers jours - #41★ 1 506+0Évolution des étoiles sur les 7 derniers jours
- #42
Code d'évaluation pour diverses métriques automatisées non supervisées destinées à la génération de langage naturel.
★ 1 391+0Évolution des étoiles sur les 7 derniers jours - #43★ 1 300+0Évolution des étoiles sur les 7 derniers jours
- #44★ 1 260+0Évolution des étoiles sur les 7 derniers jours
- #45
Un framework pour le diagnostic complet et l'optimisation d'agents via des interactions synthétiques réalistes simulées
★ 1 257+0Évolution des étoiles sur les 7 derniers jours - #46
KernelBench : Les LLM peuvent-ils écrire des noyaux GPU ? - Benchmark et boîte à outils avec Torch vers CUDA (et autres DSL)
★ 1 227+7Évolution des étoiles sur les 7 derniers jours - #47
Distribuez et exécutez des charges de travail IA sur Kubernetes comme par magie en Python, tel PyTorch pour l'infrastructure ML.
★ 1 224+0Évolution des étoiles sur les 7 derniers jours - #48★ 1 206+0Évolution des étoiles sur les 7 derniers jours
- #49
Métriques de performance haute fidélité pour les modèles génératifs sous PyTorch.
★ 1 200+1Évolution des étoiles sur les 7 derniers jours - #50
CI/CD natif pour agents IA : les échecs en production deviennent des tests de régression bloquant les PR. Détection automatique, regroupement, isolation en cas hermétiques et rejeu en CI à coût nul.
★ 1 176-22Évolution des étoiles sur les 7 derniers jours - #51
NCalc est une bibliothèque d'évaluation d'expressions rapide et légère pour .NET, conçue pour la flexibilité et la haute performance. Elle prend en charge un large éventail d'opérations mathématiques et logiques.
★ 1 156+2Évolution des étoiles sur les 7 derniers jours - #52★ 1 155+7Évolution des étoiles sur les 7 derniers jours
- #53
Évaluez les réponses de votre LLM avec Prometheus et GPT4.
★ 1 111+4Évolution des étoiles sur les 7 derniers jours - #54
Implémentations du SDK client LangSmith
★ 1 050+9Évolution des étoiles sur les 7 derniers jours - #55
API SemanticKITTI pour la visualisation de jeux de données, le traitement de données et l'évaluation des résultats.
★ 898+3Évolution des étoiles sur les 7 derniers jours - #56
Générer des données synthétiques de haute qualité, entraîner, mesurer et évaluer dans un pipeline unique
★ 885+3Évolution des étoiles sur les 7 derniers jours - #57
ClawProBench est un banc d'essai en temps réel pour évaluer les agents LLM dans le runtime OpenClaw, avec une notation déterministe et une fiabilité basée sur des essais répétés.
★ 823+0Évolution des étoiles sur les 7 derniers jours - #58
OpenJudge : Un framework unifié pour l'évaluation holistique et les récompenses de qualité.
★ 820+14Évolution des étoiles sur les 7 derniers jours - #59★ 814+1Évolution des étoiles sur les 7 derniers jours
- #60
Web Codegen Scorer est un outil pour évaluer la qualité du code web généré par les LLM.
★ 774+4Évolution des étoiles sur les 7 derniers jours