Aller au contenu principal
buildradar
Sign in
Sujet · llm-evaluation

llm-evaluation

Dépôts open source suivis étiquetés llm-evaluation, triés par étoiles.

37 dépôts
  • agent-skills-eval@darkrishabh

    Un exécuteur de tests pour les compétences d'agent IA de style agentskills.io

    724+16Évolution des étoiles sur les 7 derniers jours
  • ClawBench@TIGER-AI-Lab

    Benchmark open source pour agents IA de navigateur sur des tâches quotidiennes.

    657+54Évolution des étoiles sur les 7 derniers jours
  • Awesome-LLM-Eval : une liste organisée d'outils, de jeux de données/benchmarks, de démos, de classements, d'articles, de documentation et de modèles, principalement dédiée à l'évaluation des LLM.

    656-2Évolution des étoiles sur les 7 derniers jours
  • Sélection d'articles sur l'utilisation des LLM en sciences sociales.

    648+1Évolution des étoiles sur les 7 derniers jours
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594Évolution des étoiles sur les 7 derniers jours
  • Jeu de données et benchmark pour le RAG sur des documents internes d'entreprise.

    545+8Évolution des étoiles sur les 7 derniers jours
  • continuous-eval@relari-ai

    Évaluation basée sur les données pour les applications propulsées par LLM.

    517+1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets