Aller au contenu principal
buildradar
Sign in
Sujet · evaluation

evaluation

Dépôts open source suivis étiquetés evaluation, triés par étoiles.

80 dépôts
  • evaluation-guidebook@huggingface

    Partage d'aperçus pratiques et de connaissances théoriques sur l'évaluation des LLM, recueillis lors de la gestion de l'Open LLM Leaderboard et de la conception de lighteval.

    2 143+2Évolution des étoiles sur les 7 derniers jours
  • avalanche@ContinualAI

    Avalanche : une bibliothèque de bout en bout pour l'apprentissage continu basée sur PyTorch.

    2 088+0Évolution des étoiles sur les 7 derniers jours
  • EvalAI@Cloud-CV

    Évaluation de l'état de l'art en IA

    2 037-2Évolution des étoiles sur les 7 derniers jours
  • alpaca_eval@tatsu-lab

    Un évaluateur automatique pour les modèles de langage suivant des instructions. Validé par l'humain, de haute qualité, économique et rapide.

    2 012-1Évolution des étoiles sur les 7 derniers jours
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) Implémentation Python officielle pour « 3D Multi-Object Tracking: A Baseline and New Evaluation Metrics ».

    1 846+0Évolution des étoiles sur les 7 derniers jours
  • WFGY@onestardao

    WFGY se dirige vers le protocole WFGY 5.0 Polaris, une version open-source majeure pour le raisonnement IA, le RAG, les agents et les flux de travail réels. Inclut Problem Map, Global Debug Card, WFGY 4.0 et l'Easter Egg CFV.

    1 786+1Évolution des étoiles sur les 7 derniers jours
  • EmoLLM@SmartFlowAI

    Grand modèle de langage (LLM) pour la santé mentale, incluant pré-entraînement, post-entraînement, jeux de données, évaluation, déploiement et RAG, avec les séries de modèles InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama et GLM.

    1 781+1Évolution des étoiles sur les 7 derniers jours
  • trpc-agent-go@trpc-group

    Un framework Go pour créer des systèmes d'agents en production avec workflows graphiques, outils, mémoire, A2A, AG-UI, MCP, évaluation et observabilité.

    1 760+12Évolution des étoiles sur les 7 derniers jours
  • ragbits@deepsense-ai

    Composants de base pour le développement rapide d'applications GenAI

    1 668+0Évolution des étoiles sur les 7 derniers jours
  • Page GitHub officielle de l'article de synthèse A Survey on Evaluation of Large Language Models

    1 608-1Évolution des étoiles sur les 7 derniers jours
  • pycm@sepandhaghighi

    Bibliothèque de matrice de confusion multi-classes en Python.

    1 506+0Évolution des étoiles sur les 7 derniers jours
  • nlg-eval@Maluuba

    Code d'évaluation pour diverses métriques automatisées non supervisées destinées à la génération de langage naturel.

    1 391+0Évolution des étoiles sur les 7 derniers jours
  • lispy@abo-abo

    Édition LISP concise et efficace.

    1 300+0Évolution des étoiles sur les 7 derniers jours
  • xai@EthicalML

    XAI - Une boîte à outils d'explicabilité pour le machine learning

    1 260+0Évolution des étoiles sur les 7 derniers jours
  • intellagent@plurai-ai

    Un framework pour le diagnostic complet et l'optimisation d'agents via des interactions synthétiques réalistes simulées

    1 257+0Évolution des étoiles sur les 7 derniers jours
  • KernelBench@ScalingIntelligence

    KernelBench : Les LLM peuvent-ils écrire des noyaux GPU ? - Benchmark et boîte à outils avec Torch vers CUDA (et autres DSL)

    1 227+7Évolution des étoiles sur les 7 derniers jours
  • kubetorch@run-house

    Distribuez et exécutez des charges de travail IA sur Kubernetes comme par magie en Python, tel PyTorch pour l'infrastructure ML.

    1 224+0Évolution des étoiles sur les 7 derniers jours
  • fuzzbench@google

    FuzzBench - Service de benchmarking pour fuzzers

    1 206+0Évolution des étoiles sur les 7 derniers jours
  • torch-fidelity@toshas

    Métriques de performance haute fidélité pour les modèles génératifs sous PyTorch.

    1 200+1Évolution des étoiles sur les 7 derniers jours
  • Tracely-ai@Jwuthri

    CI/CD natif pour agents IA : les échecs en production deviennent des tests de régression bloquant les PR. Détection automatique, regroupement, isolation en cas hermétiques et rejeu en CI à coût nul.

    1 176-22Évolution des étoiles sur les 7 derniers jours
  • ncalc@ncalc

    NCalc est une bibliothèque d'évaluation d'expressions rapide et légère pour .NET, conçue pour la flexibilité et la haute performance. Elle prend en charge un large éventail d'opérations mathématiques et logiques.

    1 156+2Évolution des étoiles sur les 7 derniers jours
  • Gym@NVIDIA-NeMo

    Évaluer et améliorer les modèles et agents à l'aide d'environnements

    1 155+7Évolution des étoiles sur les 7 derniers jours
  • prometheus-eval@prometheus-eval

    Évaluez les réponses de votre LLM avec Prometheus et GPT4.

    1 111+4Évolution des étoiles sur les 7 derniers jours
  • langsmith-sdk@langchain-ai

    Implémentations du SDK client LangSmith

    1 050+9Évolution des étoiles sur les 7 derniers jours
  • API SemanticKITTI pour la visualisation de jeux de données, le traitement de données et l'évaluation des résultats.

    898+3Évolution des étoiles sur les 7 derniers jours
  • deepfabric@nolabs-ai

    Générer des données synthétiques de haute qualité, entraîner, mesurer et évaluer dans un pipeline unique

    885+3Évolution des étoiles sur les 7 derniers jours
  • ClawProBench@suyoumo

    ClawProBench est un banc d'essai en temps réel pour évaluer les agents LLM dans le runtime OpenClaw, avec une notation déterministe et une fiabilité basée sur des essais répétés.

    823+0Évolution des étoiles sur les 7 derniers jours
  • OpenJudge@agentscope-ai

    OpenJudge : Un framework unifié pour l'évaluation holistique et les récompenses de qualité.

    820+14Évolution des étoiles sur les 7 derniers jours
  • gval@PaesslerAG

    Évaluation d'expressions en golang

    814+1Évolution des étoiles sur les 7 derniers jours
  • web-codegen-scorer@angular

    Web Codegen Scorer est un outil pour évaluer la qualité du code web généré par les LLM.

    774+4Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets