Zum Hauptinhalt springen
buildradar
Sign in
Thema · llm-evaluation

llm-evaluation

Erfasste Open-Source-Repos mit dem Tag llm-evaluation, sortiert nach Sternen.

Repos
37
Sterne gesamt
234.912
Sterne im Schnitt
6.349
Anteil
0,01%

Themen, die häufig gemeinsam mit llm-evaluation am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit llm-evaluation getaggt wurden.

  • awesome-evals@benchflow-ai

    Eine kuratierte, direkte Sammlung der besten Ressourcen zum Erstellen und Evaluieren von KI-Agenten – Paper, Blogs, Vorträge, Tools, Benchmarks. Gepflegt von BenchFlow.

    865
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • KADATH@i3T4AN

    Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

    352
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 Open-Source-KI-Ingenieurplattform: LLM-Evaluierungen, Beobachtbarkeit, Metriken, Prompt-Management, Playground, Datensätze. Integriert mit OpenTelemetry, LangChain, OpenAI SDK, LiteLLM und mehr. 🍊YC W23

    34.116+207Sterne-Änderung der letzten 7 Tage
  • mlflow@mlflow

    Die Open‑Source‑KI‑Engineering‑Plattform für Agenten, Large Language Models und ML‑Modelle. MLflow ermöglicht Teams aller Größenordnungen, Produktions‑Qualitäts‑KI‑Anwendungen zu debuggen, zu bewerten, zu überwachen und zu optimieren, während Kosten kontrolliert und der Zugriff auf Modelle und Daten verwaltet wird.

    27.783+55Sterne-Änderung der letzten 7 Tage
  • promptfoo@promptfoo

    Testen Sie Ihre Prompts, Agents und RAGs. Red Teaming/Pentesting/Vulnerability-Scanning für KI. Leistungsvergleich von GPT, Claude, Gemini, DeepSeek und mehr. Einfache deklarative Konfigurationen mit Kommandozeile und CI/CD-Integration. Von OpenAI und Anthropic genutzt.

    24.767+103Sterne-Änderung der letzten 7 Tage
  • opik@comet-ml

    Debuggen, bewerten und überwachen Sie Ihre LLM-Anwendungen, RAG-Systeme und agentenbasierten Workflows mit umfassender Nachverfolgung, automatisierten Evaluierungen und produktionsreifen Dashboards.

    21.752+84Sterne-Änderung der letzten 7 Tage
  • deepeval@confident-ai

    Das LLM-Evaluierungs-Framework

    18.063+110Sterne-Änderung der letzten 7 Tage
  • iFixAi@ifixai-ai

    Unabhängige Prüfung von KI-Agenten. Ausgeführt von Menschen oder dem Agenten selbst, um die wichtigste Frage in der KI-Agenten-Wirtschaft zu beantworten: Tut der Agent das, was er tun soll? Mit iFixAi erhalten Sie diese Antwort in weniger als 120 Sekunden.

    12.643+1.247Sterne-Änderung der letzten 7 Tage
  • phoenix@Arize-ai

    KI-Observability & Evaluierung

    11.298+55Sterne-Änderung der letzten 7 Tage
  • garak@NVIDIA

    Der LLM-Schwachstellenscanner

    9.094+23Sterne-Änderung der letzten 7 Tage
  • NoneLinear ReLE-Benchmark: Eine kontinuierlich aktualisierte Leistungsbewertung für chinesische KI-Großmodelle. Das Projekt umfasst 374 kommerzielle und Open-Source-Modelle, bietet ein Ranking sowie eine Datenbank mit über 2 Millionen Fehlereinträgen zur Analyse und Verbesserung von KI-Modellen.

    6.415+6Sterne-Änderung der letzten 7 Tage
  • helicone@Helicone

    🧊 Open-Source-LLM-Observability-Plattform. Eine Zeile Code zum Überwachen, Auswerten und Experimentieren. YC W23 🍓

    6.127+11Sterne-Änderung der letzten 7 Tage
  • AI-Infra-Guard@Tencent

    Eine Full-Stack-KI-Red-Teaming-Plattform zur Sicherung von KI-Ökosystemen über Agent Scan, Skills Scan, MCP Scan, AI Infra Scan und LLM-Jailbreak-Evaluierung.

    6.117+59Sterne-Änderung der letzten 7 Tage
  • giskard-oss@Giskard-AI

    🐢 Open-Source-Evaluierungs- und Testbibliothek für LLM-Agenten

    5.801+9Sterne-Änderung der letzten 7 Tage
  • ouroboros@Q00

    Agent OS: Der Agent wird von selbst schlauer. Wir halten lediglich die Stellung: Der Bewertungsbefehl und das erwartete Ergebnis gelangen nie in den Erfolgsvertrag, den wir ihm übergeben. Interview-gesichert, stufenweise Evaluierung, budgetierte Evolutionsschleife. MCP-Server, 13 Laufzeitumgebungen: Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro und mehr.

    5.753+25Sterne-Änderung der letzten 7 Tage
  • LLM-Engineers-Handbook@PacktPublishing

    Der praktische Leitfaden für LLMs: Von den Grundlagen bis zur Bereitstellung fortgeschrittener LLM- und RAG-Anwendungen auf AWS unter Verwendung von LLMOps-Best-Practices

    5.310+8Sterne-Änderung der letzten 7 Tage
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: Jetzt kann Ihr Agent alles auf Ihrem Computer finden. Er wird intelligenter, je häufiger Sie ihn nutzen.

    5.058+1Sterne-Änderung der letzten 7 Tage
  • lmms-eval@EvolvingLMMs-Lab

    All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben

    4.390+7Sterne-Änderung der letzten 7 Tage
  • AI-Engineer-Headquarters@hemansnation

    Eine Sammlung wissenschaftlicher Methoden, Prozesse, Algorithmen und Systeme zum Erstellen von Geschichten und Modellen.

    3.676+2Sterne-Änderung der letzten 7 Tage
  • trulens@truera

    Evaluierung und Tracking für LLM-Experimente und KI-Agenten

    3.530+2Sterne-Änderung der letzten 7 Tage
  • lmnr@lmnr-ai

    Laminar – eine Open-Source-Observability-Plattform, speziell entwickelt für KI-Agenten. YC S24.

    3.219+9Sterne-Änderung der letzten 7 Tage
  • generative-ai@genieincodebottle

    Umfassende Ressourcen zu Generative AI, einschließlich einer detaillierten Roadmap, Projekten, Anwendungsfällen, Interviewvorbereitung und Programmiervorbereitung.

    2.610+1Sterne-Änderung der letzten 7 Tage
  • agentic_security@msoedov

    Agentenbasierter LLM-Schwachstellenscanner / KI-Red-Teaming-Kit 🧪

    1.983+3Sterne-Änderung der letzten 7 Tage
  • future-agi@future-agi

    Open-Source-End-to-End-Plattform zum Evaluieren, Überwachen und Verbessern von LLM- und KI-Agenten-Anwendungen. Tracing · Evals · Simulationen · Datasets · Gateway · Guardrails. Selbst hostbar. Apache 2.0.

    1.909+42Sterne-Änderung der letzten 7 Tage
  • aisheets@huggingface

    Datensätze ohne Code mithilfe von KI-Modellen erstellen, anichern und transformieren

    1.641-1Sterne-Änderung der letzten 7 Tage
  • FuzzyAI@cyberark

    Ein leistungsstarkes Tool für automatisiertes LLM-Fuzzing. Es wurde entwickelt, um Entwicklern und Sicherheitsforschern dabei zu helfen, potenzielle Jailbreaks in ihren LLM-APIs zu identifizieren und zu entschärfen.

    1.573+4Sterne-Änderung der letzten 7 Tage
  • prompty@microsoft

    Prompty erleichtert das Erstellen, Verwalten, Debuggen und Evaluieren von LLM-Prompts für KI-Anwendungen. Prompty ist eine Asset-Klasse und ein Format für LLM-Prompts, das die Beobachtbarkeit, Verständlichkeit und Portabilität für Entwickler verbessern soll.

    1.255+1Sterne-Änderung der letzten 7 Tage
  • uqlm@cvs-health

    [JMLR 2026] „UQLM: Ein Python-Paket zur Quantifizierung von Unsicherheiten in Large Language Models“

    1.194+1Sterne-Änderung der letzten 7 Tage
  • Tracely-ai@Jwuthri

    Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.

    1.176-22Sterne-Änderung der letzten 7 Tage
  • judgeval@JudgmentLabs

    Der Continuous-Improvement-Stack für Agenten. Unsere Umgebungsdaten und Evaluierungen treiben die Verbesserung und Überwachung von Agenten voran.

    1.060+2Sterne-Änderung der letzten 7 Tage
  • FinSight-AI@juanjuandog

    KI-Aktienanalyse-Agent mit resilienten Workflows, evidenzbasierter RAG, versionierten Berichten und automatisierter Qualitätsbewertung.

    1.031-2Sterne-Änderung der letzten 7 Tage
  • awesome-evals@benchflow-ai

    Eine kuratierte, direkte Sammlung der besten Ressourcen zum Erstellen und Evaluieren von KI-Agenten – Paper, Blogs, Vorträge, Tools, Benchmarks. Gepflegt von BenchFlow.

    865+17Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen