evaluation
Dépôts open source suivis étiquetés evaluation, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de evaluation sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés evaluation.
- #1
Le workflow Fable : comment Claude Fable 5 a fonctionné, distillé en compétences exécutables par n'importe quel modèle, avec une évaluation pour garantir sa fiabilité. Penser / agir / prouver.
★ 2 267 - #2
CI/CD natif pour agents IA : les échecs en production deviennent des tests de régression bloquant les PR. Détection automatique, regroupement, isolation en cas hermétiques et rejeu en CI à coût nul.
★ 1 159 - #3
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
Plateforme d'ingénierie IA open source : évaluations LLM, observabilité, métriques, gestion de prompts, playground et jeux de données. Intégration avec OpenTelemetry, LangChain, OpenAI SDK, LiteLLM et plus encore. 🍊 YC W23
★ 33 909+372Évolution des étoiles sur les 7 derniers jours - #2
La plateforme d'ingénierie IA open source pour les agents, les LLM et les modèles de ML. MLflow permet aux équipes de toutes tailles de déboguer, d'évaluer, de surveiller et d'optimiser des applications IA de qualité production tout en maîtrisant les coûts et en gérant l'accès aux modèles et aux données.
★ 27 728+114Évolution des étoiles sur les 7 derniers jours - #3
Testez vos prompts, agents et RAG. Red teaming, pentesting et analyse de vulnérabilités pour l'IA. Comparez les performances de GPT, Claude, Gemini, DeepSeek et plus encore. Configurations déclaratives simples avec intégration en ligne de commande et CI/CD. Utilisé par OpenAI et Anthropic.
★ 24 664+215Évolution des étoiles sur les 7 derniers jours - #4
Déboguez, évaluez et surveillez vos applications LLM, systèmes RAG et workflows d'agents avec un traçage complet, des évaluations automatisées et des tableaux de bord prêts pour la production.
★ 21 668+143Évolution des étoiles sur les 7 derniers jours - #5
Plateforme de connaissances LLM open-source : transformez des documents bruts en un RAG interrogeable, un agent de raisonnement autonome et un wiki auto-maintenu.
★ 20 899+581Évolution des étoiles sur les 7 derniers jours - #6★ 15 541+123Évolution des étoiles sur les 7 derniers jours
- #7★ 9 380+3Évolution des étoiles sur les 7 derniers jours
- #8
OpenCompass est une plateforme d'évaluation LLM, prenant en charge une large gamme de modèles (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, etc.) sur plus de 100 jeux de données.
★ 7 374+48Évolution des étoiles sur les 7 derniers jours - #9
Plateforme d'observabilité LLM open source. Une ligne de code pour surveiller, évaluer et expérimenter. YC W23
★ 6 116+23Évolution des étoiles sur les 7 derniers jours - #10
Plateforme d'optimisation d'agents IA de nouvelle génération : Cozeloop résout les défis du développement d'agents IA en offrant des capacités de gestion sur tout le cycle de vie, du développement au débogage, en passant par l'évaluation et la surveillance.
★ 5 706+7Évolution des étoiles sur les 7 derniers jours - #11
AutoRAG : permet à votre agent de trouver n'importe quel élément sur votre ordinateur et devient plus intelligent à mesure que vous l'utilisez.
★ 5 057+7Évolution des étoiles sur les 7 derniers jours - #12
Construisez, évaluez et optimisez des systèmes d'IA. Inclut des évaluations, RAG, agents, fine-tuning, génération de données synthétiques, gestion de jeux de données, MCP, et plus encore.
★ 5 037+7Évolution des étoiles sur les 7 derniers jours - #13
Boîte à outils d'évaluation multimodale tout-en-un pour les tâches textuelles, d'image, vidéo et audio.
★ 4 383+11Évolution des étoiles sur les 7 derniers jours - #14
Boîte à outils d'évaluation open-source pour grands modèles multimodaux (LMM), prenant en charge plus de 220 LMM et 80 benchmarks
★ 4 362+10Évolution des étoiles sur les 7 derniers jours - #15★ 4 310+7Évolution des étoiles sur les 7 derniers jours
- #16★ 3 517+13Évolution des étoiles sur les 7 derniers jours
- #17
MTEB : Évaluation de pointe des embeddings à travers les langues et les modalités
★ 3 409+9Évolution des étoiles sur les 7 derniers jours - #18
Un framework rationalisé et personnalisable pour l'évaluation efficace et le benchmarking de performance des grands modèles (LLM, VLM, AIGC).
★ 3 331+47Évolution des étoiles sur les 7 derniers jours - #19★ 3 299-1Évolution des étoiles sur les 7 derniers jours
- #20★ 3 210+24Évolution des étoiles sur les 7 derniers jours
- #21
Klipse est un plugin JavaScript permettant d'intégrer des extraits de code interactifs dans des blogs techniques.
★ 3 134+0Évolution des étoiles sur les 7 derniers jours - #22
Un environnement de programmation visuelle open source pour tester les prompts destinés aux LLM.
★ 3 028+1Évolution des étoiles sur les 7 derniers jours - #23
YAO = Yielding AI Outcomes. Un système rigoureux d'ingénierie, d'évaluation, de gouvernance et de portabilité pour les compétences d'agents réutilisables.
★ 2 557+160Évolution des étoiles sur les 7 derniers jours - #24
Lighteval est votre boîte à outils tout-en-un pour évaluer les LLM sur plusieurs backends.
★ 2 530+8Évolution des étoiles sur les 7 derniers jours - #25
🤗 Evaluate : Une bibliothèque pour évaluer facilement les modèles et jeux de données d'apprentissage automatique.
★ 2 480+2Évolution des étoiles sur les 7 derniers jours - #26
UpTrain est une plateforme open-source unifiée pour évaluer et améliorer les applications d'IA générative. Nous fournissons des scores pour plus de 20 contrôles préconfigurés (couvrant le langage, le code et les cas d'usage d'embedding), effectuons une analyse des causes profondes des échecs et proposons des pistes de résolution.
★ 2 364+3Évolution des étoiles sur les 7 derniers jours - #27
Intégration de GraphRAG, LightRAG et Neo4j-llm-graph-builder pour la construction et la recherche de graphes de connaissances. Combine la technologie DeepSearch pour le raisonnement RAG privé et inclut un framework d'évaluation personnalisé pour GraphRAG.
★ 2 330+8Évolution des étoiles sur les 7 derniers jours - #28
Le workflow Fable : comment Claude Fable 5 a fonctionné, distillé en compétences exécutables par n'importe quel modèle, avec une évaluation pour garantir sa fiabilité. Penser / agir / prouver.
★ 2 267+23Évolution des étoiles sur les 7 derniers jours - #29
Plateforme de test et d'évaluation pour discuter, inspecter et déboguer les serveurs MCP, les applications MCP et les applications ChatGPT.
★ 2 177+23Évolution des étoiles sur les 7 derniers jours - #30
Articles et blogs incontournables sur la modélisation de contexte long basée sur les LLM
★ 2 165+2Évolution des étoiles sur les 7 derniers jours