evaluation
Dépôts open source suivis étiquetés evaluation, triés par étoiles.
- #61★ 768+0Évolution des étoiles sur les 7 derniers jours
- #62
[EMNLP 2024 & AAAI 2026] Une boîte à outils puissante pour la compression de grands modèles, incluant les LLM, les VLM et les modèles génératifs vidéo.
★ 747+4Évolution des étoiles sur les 7 derniers jours - #63
🦞 Plugin officiel pour OpenClaw qui exporte les traces d'agents vers Opik. Visualisez et surveillez le comportement des agents, les coûts, les jetons, les erreurs et plus encore.
★ 725+0Évolution des étoiles sur les 7 derniers jours - #64
Implémentation Python de l'IOU Tracker
★ 702+0Évolution des étoiles sur les 7 derniers jours - #65
⚡️Une bibliothèque Python ultra-rapide pour l'évaluation, la comparaison et la fusion de classements 🐍
★ 697+4Évolution des étoiles sur les 7 derniers jours - #66
Évaluation comparative de la factualité à long format dans les grands modèles de langage. Code source original de notre article "Long-form factuality in large language models".
★ 693+2Évolution des étoiles sur les 7 derniers jours - #67
Benchmark open source pour agents IA de navigateur sur des tâches quotidiennes.
★ 664+61Évolution des étoiles sur les 7 derniers jours - #68
Awesome-LLM-Eval : une liste organisée d'outils, de jeux de données/benchmarks, de démos, de classements, d'articles, de documentation et de modèles, principalement dédiée à l'évaluation des LLM.
★ 656-2Évolution des étoiles sur les 7 derniers jours - #69
AutoPrompt : Construction automatique de prompts pour les modèles de langage masqués.
★ 641+0Évolution des étoiles sur les 7 derniers jours - #70★ 632+2Évolution des étoiles sur les 7 derniers jours
- #71
Un évaluateur d'expressions mathématiques et pseudo-C# simple dans un seul fichier C#. Peut également exécuter de petits scripts de type C#.
★ 630+0Évolution des étoiles sur les 7 derniers jours - #72
Un dépôt de ressources pour le désapprentissage automatique dans les grands modèles de langage
★ 624+0Évolution des étoiles sur les 7 derniers jours - #73
TCExam est un système CBA (Computer-Based Assessment) (e-exam, CBT - Computer Based Testing) destiné aux universités, écoles et entreprises, qui permet aux éducateurs et formateurs de créer, planifier, diffuser et générer des rapports sur des sondages, des quiz, des tests et des examens.
★ 621+0Évolution des étoiles sur les 7 derniers jours - #74
Évaluateur d'expressions simple, sûr, cloisonné et extensible pour Python
★ 611+0Évolution des étoiles sur les 7 derniers jours - #75
Ce dépôt contient le code d'évaluation pour l'article "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 594+1Évolution des étoiles sur les 7 derniers jours - #76
Ceci est un dépôt d'outils pour aider à évaluer diverses méthodes effectuant la mise en correspondance d'images à partir d'une paire d'images.
★ 594+0Évolution des étoiles sur les 7 derniers jours - #77
Une collection de jeux de données associant des questions à des requêtes SQL.
★ 588+1Évolution des étoiles sur les 7 derniers jours - #78
ParseBench - Un benchmark d'analyse de documents pour les agents IA.
★ 565+12Évolution des étoiles sur les 7 derniers jours - #79
Meta Agents Research Environments est une plateforme complète conçue pour évaluer les agents IA dans des scénarios dynamiques et réalistes. Contrairement aux benchmarks statiques, cette plateforme introduit des environnements évolutifs où les agents doivent adapter leurs stratégies à mesure que de nouvelles informations deviennent disponibles, reflétant les défis du monde réel.
★ 551+3Évolution des étoiles sur les 7 derniers jours - #80
Jeu de données et benchmark pour le RAG sur des documents internes d'entreprise.
★ 546+11Évolution des étoiles sur les 7 derniers jours