llm-evaluation
Erfasste Open-Source-Repos mit dem Tag llm-evaluation, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit llm-evaluation am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit llm-evaluation getaggt wurden.
- #1
Eine kuratierte, direkte Sammlung der besten Ressourcen zum Erstellen und Evaluieren von KI-Agenten – Paper, Blogs, Vorträge, Tools, Benchmarks. Gepflegt von BenchFlow.
★ 865 - #2
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594 - #3
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
★ 352 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 Open-Source-KI-Ingenieurplattform: LLM-Evaluierungen, Beobachtbarkeit, Metriken, Prompt-Management, Playground, Datensätze. Integriert mit OpenTelemetry, LangChain, OpenAI SDK, LiteLLM und mehr. 🍊YC W23
★ 34.116+207Sterne-Änderung der letzten 7 Tage - #2
Die Open‑Source‑KI‑Engineering‑Plattform für Agenten, Large Language Models und ML‑Modelle. MLflow ermöglicht Teams aller Größenordnungen, Produktions‑Qualitäts‑KI‑Anwendungen zu debuggen, zu bewerten, zu überwachen und zu optimieren, während Kosten kontrolliert und der Zugriff auf Modelle und Daten verwaltet wird.
★ 27.783+55Sterne-Änderung der letzten 7 Tage - #3
Testen Sie Ihre Prompts, Agents und RAGs. Red Teaming/Pentesting/Vulnerability-Scanning für KI. Leistungsvergleich von GPT, Claude, Gemini, DeepSeek und mehr. Einfache deklarative Konfigurationen mit Kommandozeile und CI/CD-Integration. Von OpenAI und Anthropic genutzt.
★ 24.767+103Sterne-Änderung der letzten 7 Tage - #4
Debuggen, bewerten und überwachen Sie Ihre LLM-Anwendungen, RAG-Systeme und agentenbasierten Workflows mit umfassender Nachverfolgung, automatisierten Evaluierungen und produktionsreifen Dashboards.
★ 21.752+84Sterne-Änderung der letzten 7 Tage - #5★ 18.063+110Sterne-Änderung der letzten 7 Tage
- #6
Unabhängige Prüfung von KI-Agenten. Ausgeführt von Menschen oder dem Agenten selbst, um die wichtigste Frage in der KI-Agenten-Wirtschaft zu beantworten: Tut der Agent das, was er tun soll? Mit iFixAi erhalten Sie diese Antwort in weniger als 120 Sekunden.
★ 12.643+1.247Sterne-Änderung der letzten 7 Tage - #7★ 11.298+55Sterne-Änderung der letzten 7 Tage
- #8★ 9.094+23Sterne-Änderung der letzten 7 Tage
- #9
NoneLinear ReLE-Benchmark: Eine kontinuierlich aktualisierte Leistungsbewertung für chinesische KI-Großmodelle. Das Projekt umfasst 374 kommerzielle und Open-Source-Modelle, bietet ein Ranking sowie eine Datenbank mit über 2 Millionen Fehlereinträgen zur Analyse und Verbesserung von KI-Modellen.
★ 6.415+6Sterne-Änderung der letzten 7 Tage - #10
🧊 Open-Source-LLM-Observability-Plattform. Eine Zeile Code zum Überwachen, Auswerten und Experimentieren. YC W23 🍓
★ 6.127+11Sterne-Änderung der letzten 7 Tage - #11
Eine Full-Stack-KI-Red-Teaming-Plattform zur Sicherung von KI-Ökosystemen über Agent Scan, Skills Scan, MCP Scan, AI Infra Scan und LLM-Jailbreak-Evaluierung.
★ 6.117+59Sterne-Änderung der letzten 7 Tage - #12
🐢 Open-Source-Evaluierungs- und Testbibliothek für LLM-Agenten
★ 5.801+9Sterne-Änderung der letzten 7 Tage - #13
Agent OS: Der Agent wird von selbst schlauer. Wir halten lediglich die Stellung: Der Bewertungsbefehl und das erwartete Ergebnis gelangen nie in den Erfolgsvertrag, den wir ihm übergeben. Interview-gesichert, stufenweise Evaluierung, budgetierte Evolutionsschleife. MCP-Server, 13 Laufzeitumgebungen: Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro und mehr.
★ 5.753+25Sterne-Änderung der letzten 7 Tage - #14
Der praktische Leitfaden für LLMs: Von den Grundlagen bis zur Bereitstellung fortgeschrittener LLM- und RAG-Anwendungen auf AWS unter Verwendung von LLMOps-Best-Practices
★ 5.310+8Sterne-Änderung der letzten 7 Tage - #15
AutoRAG: Jetzt kann Ihr Agent alles auf Ihrem Computer finden. Er wird intelligenter, je häufiger Sie ihn nutzen.
★ 5.058+1Sterne-Änderung der letzten 7 Tage - #16
All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben
★ 4.390+7Sterne-Änderung der letzten 7 Tage - #17
Eine Sammlung wissenschaftlicher Methoden, Prozesse, Algorithmen und Systeme zum Erstellen von Geschichten und Modellen.
★ 3.676+2Sterne-Änderung der letzten 7 Tage - #18★ 3.530+2Sterne-Änderung der letzten 7 Tage
- #19
Laminar – eine Open-Source-Observability-Plattform, speziell entwickelt für KI-Agenten. YC S24.
★ 3.219+9Sterne-Änderung der letzten 7 Tage - #20
Umfassende Ressourcen zu Generative AI, einschließlich einer detaillierten Roadmap, Projekten, Anwendungsfällen, Interviewvorbereitung und Programmiervorbereitung.
★ 2.610+1Sterne-Änderung der letzten 7 Tage - #21
Agentenbasierter LLM-Schwachstellenscanner / KI-Red-Teaming-Kit 🧪
★ 1.983+3Sterne-Änderung der letzten 7 Tage - #22
Open-Source-End-to-End-Plattform zum Evaluieren, Überwachen und Verbessern von LLM- und KI-Agenten-Anwendungen. Tracing · Evals · Simulationen · Datasets · Gateway · Guardrails. Selbst hostbar. Apache 2.0.
★ 1.909+42Sterne-Änderung der letzten 7 Tage - #23
Datensätze ohne Code mithilfe von KI-Modellen erstellen, anichern und transformieren
★ 1.641-1Sterne-Änderung der letzten 7 Tage - #24
Ein leistungsstarkes Tool für automatisiertes LLM-Fuzzing. Es wurde entwickelt, um Entwicklern und Sicherheitsforschern dabei zu helfen, potenzielle Jailbreaks in ihren LLM-APIs zu identifizieren und zu entschärfen.
★ 1.573+4Sterne-Änderung der letzten 7 Tage - #25
Prompty erleichtert das Erstellen, Verwalten, Debuggen und Evaluieren von LLM-Prompts für KI-Anwendungen. Prompty ist eine Asset-Klasse und ein Format für LLM-Prompts, das die Beobachtbarkeit, Verständlichkeit und Portabilität für Entwickler verbessern soll.
★ 1.255+1Sterne-Änderung der letzten 7 Tage - #26
[JMLR 2026] „UQLM: Ein Python-Paket zur Quantifizierung von Unsicherheiten in Large Language Models“
★ 1.194+1Sterne-Änderung der letzten 7 Tage - #27
Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.
★ 1.176-22Sterne-Änderung der letzten 7 Tage - #28
Der Continuous-Improvement-Stack für Agenten. Unsere Umgebungsdaten und Evaluierungen treiben die Verbesserung und Überwachung von Agenten voran.
★ 1.060+2Sterne-Änderung der letzten 7 Tage - #29
KI-Aktienanalyse-Agent mit resilienten Workflows, evidenzbasierter RAG, versionierten Berichten und automatisierter Qualitätsbewertung.
★ 1.031-2Sterne-Änderung der letzten 7 Tage - #30
Eine kuratierte, direkte Sammlung der besten Ressourcen zum Erstellen und Evaluieren von KI-Agenten – Paper, Blogs, Vorträge, Tools, Benchmarks. Gepflegt von BenchFlow.
★ 865+17Sterne-Änderung der letzten 7 Tage