Aller au contenu principal
buildradar
Sign in
Sujet · evaluation

evaluation

Dépôts open source suivis étiquetés evaluation, triés par étoiles.

Dépôts
80
Total d'étoiles
291 588
Étoiles en moyenne
3 645
Part
0,02%

Sujets qui apparaissent souvent aux côtés de evaluation sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés evaluation.

  • fable-method@Sahir619

    Le workflow Fable : comment Claude Fable 5 a fonctionné, distillé en compétences exécutables par n'importe quel modèle, avec une évaluation pour garantir sa fiabilité. Penser / agir / prouver.

    2 267
  • Tracely-ai@Jwuthri

    CI/CD natif pour agents IA : les échecs en production deviennent des tests de régression bloquant les PR. Détection automatique, regroupement, isolation en cas hermétiques et rejeu en CI à coût nul.

    1 159
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    Plateforme d'ingénierie IA open source : évaluations LLM, observabilité, métriques, gestion de prompts, playground et jeux de données. Intégration avec OpenTelemetry, LangChain, OpenAI SDK, LiteLLM et plus encore. 🍊 YC W23

    33 909+372Évolution des étoiles sur les 7 derniers jours
  • mlflow@mlflow

    La plateforme d'ingénierie IA open source pour les agents, les LLM et les modèles de ML. MLflow permet aux équipes de toutes tailles de déboguer, d'évaluer, de surveiller et d'optimiser des applications IA de qualité production tout en maîtrisant les coûts et en gérant l'accès aux modèles et aux données.

    27 728+114Évolution des étoiles sur les 7 derniers jours
  • promptfoo@promptfoo

    Testez vos prompts, agents et RAG. Red teaming, pentesting et analyse de vulnérabilités pour l'IA. Comparez les performances de GPT, Claude, Gemini, DeepSeek et plus encore. Configurations déclaratives simples avec intégration en ligne de commande et CI/CD. Utilisé par OpenAI et Anthropic.

    24 664+215Évolution des étoiles sur les 7 derniers jours
  • opik@comet-ml

    Déboguez, évaluez et surveillez vos applications LLM, systèmes RAG et workflows d'agents avec un traçage complet, des évaluations automatisées et des tableaux de bord prêts pour la production.

    21 668+143Évolution des étoiles sur les 7 derniers jours
  • WeKnora@Tencent

    Plateforme de connaissances LLM open-source : transformez des documents bruts en un RAG interrogeable, un agent de raisonnement autonome et un wiki auto-maintenu.

    20 899+581Évolution des étoiles sur les 7 derniers jours
  • ragas@vibrantlabsai

    Optimisez les évaluations de vos applications LLM.

    15 541+123Évolution des étoiles sur les 7 derniers jours
  • oumi@oumi-ai

    Fine-tunez, évaluez et déployez facilement Qwen, Gemma ou tout LLM à poids ouverts !

    9 380+3Évolution des étoiles sur les 7 derniers jours
  • opencompass@open-compass

    OpenCompass est une plateforme d'évaluation LLM, prenant en charge une large gamme de modèles (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, etc.) sur plus de 100 jeux de données.

    7 374+48Évolution des étoiles sur les 7 derniers jours
  • helicone@Helicone

    Plateforme d'observabilité LLM open source. Une ligne de code pour surveiller, évaluer et expérimenter. YC W23

    6 116+23Évolution des étoiles sur les 7 derniers jours
  • coze-loop@coze-dev

    Plateforme d'optimisation d'agents IA de nouvelle génération : Cozeloop résout les défis du développement d'agents IA en offrant des capacités de gestion sur tout le cycle de vie, du développement au débogage, en passant par l'évaluation et la surveillance.

    5 706+7Évolution des étoiles sur les 7 derniers jours
  • AutoRAG@Marker-Inc-Korea

    AutoRAG : permet à votre agent de trouver n'importe quel élément sur votre ordinateur et devient plus intelligent à mesure que vous l'utilisez.

    5 057+7Évolution des étoiles sur les 7 derniers jours
  • Kiln@Kiln-AI

    Construisez, évaluez et optimisez des systèmes d'IA. Inclut des évaluations, RAG, agents, fine-tuning, génération de données synthétiques, gestion de jeux de données, MCP, et plus encore.

    5 037+7Évolution des étoiles sur les 7 derniers jours
  • lmms-eval@EvolvingLMMs-Lab

    Boîte à outils d'évaluation multimodale tout-en-un pour les tâches textuelles, d'image, vidéo et audio.

    4 383+11Évolution des étoiles sur les 7 derniers jours
  • VLMEvalKit@open-compass

    Boîte à outils d'évaluation open-source pour grands modèles multimodaux (LMM), prenant en charge plus de 220 LMM et 80 benchmarks

    4 362+10Évolution des étoiles sur les 7 derniers jours
  • evo@MichaelGrupp

    Package Python pour l'évaluation de l'odométrie et du SLAM.

    4 310+7Évolution des étoiles sur les 7 derniers jours
  • langwatch@langwatch

    Plateforme pour l'évaluation de LLM et le test d'agents IA

    3 517+13Évolution des étoiles sur les 7 derniers jours
  • mteb@embeddings-benchmark

    MTEB : Évaluation de pointe des embeddings à travers les langues et les modalités

    3 409+9Évolution des étoiles sur les 7 derniers jours
  • evalscope@modelscope

    Un framework rationalisé et personnalisable pour l'évaluation efficace et le benchmarking de performance des grands modèles (LLM, VLM, AIGC).

    3 331+47Évolution des étoiles sur les 7 derniers jours
  • SuperCLUE@CLUEbenchmark

    SuperCLUE : Benchmark complet pour les grands modèles de langage chinois.

    3 299-1Évolution des étoiles sur les 7 derniers jours
  • lmnr@lmnr-ai

    Laminar - plateforme d'observabilité open source conçue pour les agents IA. YC S24.

    3 210+24Évolution des étoiles sur les 7 derniers jours
  • klipse@viebel

    Klipse est un plugin JavaScript permettant d'intégrer des extraits de code interactifs dans des blogs techniques.

    3 134+0Évolution des étoiles sur les 7 derniers jours
  • ChainForge@ianarawjo

    Un environnement de programmation visuelle open source pour tester les prompts destinés aux LLM.

    3 028+1Évolution des étoiles sur les 7 derniers jours
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes. Un système rigoureux d'ingénierie, d'évaluation, de gouvernance et de portabilité pour les compétences d'agents réutilisables.

    2 557+160Évolution des étoiles sur les 7 derniers jours
  • lighteval@huggingface

    Lighteval est votre boîte à outils tout-en-un pour évaluer les LLM sur plusieurs backends.

    2 530+8Évolution des étoiles sur les 7 derniers jours
  • evaluate@huggingface

    🤗 Evaluate : Une bibliothèque pour évaluer facilement les modèles et jeux de données d'apprentissage automatique.

    2 480+2Évolution des étoiles sur les 7 derniers jours
  • uptrain@uptrain-ai

    UpTrain est une plateforme open-source unifiée pour évaluer et améliorer les applications d'IA générative. Nous fournissons des scores pour plus de 20 contrôles préconfigurés (couvrant le langage, le code et les cas d'usage d'embedding), effectuons une analyse des causes profondes des échecs et proposons des pistes de résolution.

    2 364+3Évolution des étoiles sur les 7 derniers jours
  • graph-rag-agent@1517005260

    Intégration de GraphRAG, LightRAG et Neo4j-llm-graph-builder pour la construction et la recherche de graphes de connaissances. Combine la technologie DeepSearch pour le raisonnement RAG privé et inclut un framework d'évaluation personnalisé pour GraphRAG.

    2 330+8Évolution des étoiles sur les 7 derniers jours
  • fable-method@Sahir619

    Le workflow Fable : comment Claude Fable 5 a fonctionné, distillé en compétences exécutables par n'importe quel modèle, avec une évaluation pour garantir sa fiabilité. Penser / agir / prouver.

    2 267+23Évolution des étoiles sur les 7 derniers jours
  • inspector@MCPJam

    Plateforme de test et d'évaluation pour discuter, inspecter et déboguer les serveurs MCP, les applications MCP et les applications ChatGPT.

    2 177+23Évolution des étoiles sur les 7 derniers jours
  • Articles et blogs incontournables sur la modélisation de contexte long basée sur les LLM

    2 165+2Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets