Aller au contenu principal
buildradar
Sign in
Sujet · evaluation

evaluation

Dépôts open source suivis étiquetés evaluation, triés par étoiles.

80 dépôts
  • RAG-FiT@IntelLabs

    Framework pour améliorer les LLM pour les tâches RAG via le fine-tuning.

    768+0Évolution des étoiles sur les 7 derniers jours
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Une boîte à outils puissante pour la compression de grands modèles, incluant les LLM, les VLM et les modèles génératifs vidéo.

    747+4Évolution des étoiles sur les 7 derniers jours
  • opik-openclaw@comet-ml

    🦞 Plugin officiel pour OpenClaw qui exporte les traces d'agents vers Opik. Visualisez et surveillez le comportement des agents, les coûts, les jetons, les erreurs et plus encore.

    725+0Évolution des étoiles sur les 7 derniers jours
  • iou-tracker@bochinski

    Implémentation Python de l'IOU Tracker

    702+0Évolution des étoiles sur les 7 derniers jours
  • ranx@AmenRa

    ⚡️Une bibliothèque Python ultra-rapide pour l'évaluation, la comparaison et la fusion de classements 🐍

    697+4Évolution des étoiles sur les 7 derniers jours
  • long-form-factuality@google-deepmind

    Évaluation comparative de la factualité à long format dans les grands modèles de langage. Code source original de notre article "Long-form factuality in large language models".

    693+2Évolution des étoiles sur les 7 derniers jours
  • ClawBench@TIGER-AI-Lab

    Benchmark open source pour agents IA de navigateur sur des tâches quotidiennes.

    664+61Évolution des étoiles sur les 7 derniers jours
  • Awesome-LLM-Eval : une liste organisée d'outils, de jeux de données/benchmarks, de démos, de classements, d'articles, de documentation et de modèles, principalement dédiée à l'évaluation des LLM.

    656-2Évolution des étoiles sur les 7 derniers jours
  • autoprompt@ucinlp

    AutoPrompt : Construction automatique de prompts pour les modèles de langage masqués.

    641+0Évolution des étoiles sur les 7 derniers jours
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM : La fiabilité dans les grands modèles de langage

    632+2Évolution des étoiles sur les 7 derniers jours
  • Un évaluateur d'expressions mathématiques et pseudo-C# simple dans un seul fichier C#. Peut également exécuter de petits scripts de type C#.

    630+0Évolution des étoiles sur les 7 derniers jours
  • Un dépôt de ressources pour le désapprentissage automatique dans les grands modèles de langage

    624+0Évolution des étoiles sur les 7 derniers jours
  • tcexam@tecnickcom

    TCExam est un système CBA (Computer-Based Assessment) (e-exam, CBT - Computer Based Testing) destiné aux universités, écoles et entreprises, qui permet aux éducateurs et formateurs de créer, planifier, diffuser et générer des rapports sur des sondages, des quiz, des tests et des examens.

    621+0Évolution des étoiles sur les 7 derniers jours
  • simpleeval@danthedeckie

    Évaluateur d'expressions simple, sûr, cloisonné et extensible pour Python

    611+0Évolution des étoiles sur les 7 derniers jours
  • MMMU@MMMU-Benchmark

    Ce dépôt contient le code d'évaluation pour l'article "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

    594+1Évolution des étoiles sur les 7 derniers jours
  • image-matching-toolbox@GrumpyZhou

    Ceci est un dépôt d'outils pour aider à évaluer diverses méthodes effectuant la mise en correspondance d'images à partir d'une paire d'images.

    594+0Évolution des étoiles sur les 7 derniers jours
  • text2sql-data@jkkummerfeld

    Une collection de jeux de données associant des questions à des requêtes SQL.

    588+1Évolution des étoiles sur les 7 derniers jours
  • ParseBench@run-llama

    ParseBench - Un benchmark d'analyse de documents pour les agents IA.

    565+12Évolution des étoiles sur les 7 derniers jours
  • Meta Agents Research Environments est une plateforme complète conçue pour évaluer les agents IA dans des scénarios dynamiques et réalistes. Contrairement aux benchmarks statiques, cette plateforme introduit des environnements évolutifs où les agents doivent adapter leurs stratégies à mesure que de nouvelles informations deviennent disponibles, reflétant les défis du monde réel.

    551+3Évolution des étoiles sur les 7 derniers jours
  • Jeu de données et benchmark pour le RAG sur des documents internes d'entreprise.

    546+11Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets