evaluation
Erfasste Open-Source-Repos mit dem Tag evaluation, sortiert nach Sternen.
- #31
Teilen von praktischen Einblicken und theoretischem Wissen zur LLM-Evaluierung, die wir bei der Verwaltung des Open LLM Leaderboards und der Entwicklung von lighteval gesammelt haben!
★ 2.143+2Sterne-Änderung der letzten 7 Tage - #32
Avalanche: Eine End-to-End-Bibliothek für Continual Learning auf Basis von PyTorch
★ 2.088+0Sterne-Änderung der letzten 7 Tage - #33
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Evaluierung des State of the Art in der KI
★ 2.037-2Sterne-Änderung der letzten 7 Tage - #34
Ein automatischer Evaluator für anweisungsbefolgende Sprachmodelle. Von Menschen validiert, qualitativ hochwertig, günstig und schnell.
★ 2.012-1Sterne-Änderung der letzten 7 Tage - #35
(IROS 2020, ECCVW 2020) Offizielle Python-Implementierung für „3D Multi-Object Tracking: A Baseline and New Evaluation Metrics“
★ 1.846+0Sterne-Änderung der letzten 7 Tage - #36
WFGY steuert auf das WFGY 5.0 Polaris Protocol zu, ein großes Open-Source-Release für KI-Reasoning, RAG, Agenten und reale Workflows. Enthält Problem Map, Global Debug Card, WFGY 4.0 und das CFV Easter Egg.
★ 1.786+1Sterne-Änderung der letzten 7 Tage - #37
Großes Sprachmodell für psychische Gesundheit (LLM x Mental Health), Pre- & Post-Training, Datensatz, Evaluierung, Bereitstellung & RAG, kompatibel mit den Serien InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLaMA und GLM.
★ 1.781+1Sterne-Änderung der letzten 7 Tage - #38
Ein Go-Framework zum Erstellen von produktionsreifen Agentensystemen mit Graph-Workflows, Tools, Speicher, A2A, AG-UI, MCP, Evaluierung und Observability.
★ 1.760+12Sterne-Änderung der letzten 7 Tage - #39★ 1.668+0Sterne-Änderung der letzten 7 Tage
- #40
Die offizielle GitHub-Seite für das Survey-Paper „A Survey on Evaluation of Large Language Models“.
★ 1.608-1Sterne-Änderung der letzten 7 Tage - #41★ 1.506+0Sterne-Änderung der letzten 7 Tage
- #42
Evaluierungscode für verschiedene unüberwachte automatisierte Metriken zur natürlichen Sprachgenerierung (NLG).
★ 1.391+0Sterne-Änderung der letzten 7 Tage - #43★ 1.300+0Sterne-Änderung der letzten 7 Tage
- #44★ 1.260+0Sterne-Änderung der letzten 7 Tage
- #45
Ein Framework zur umfassenden Diagnose und Optimierung von Agenten anhand simulierter, realistischer synthetischer Interaktionen
★ 1.257+0Sterne-Änderung der letzten 7 Tage - #46
KernelBench: Können LLMs GPU-Kernel schreiben? – Benchmark + Toolkit mit Torch -> CUDA (+ weitere DSLs)
★ 1.227+7Sterne-Änderung der letzten 7 Tage - #47
KI-Workloads in Python magisch auf Kubernetes verteilen und ausführen, wie PyTorch für ML-Infra.
★ 1.224+0Sterne-Änderung der letzten 7 Tage - #48★ 1.206+0Sterne-Änderung der letzten 7 Tage
- #49
High-Fidelity-Leistungsmetriken für generative Modelle in PyTorch
★ 1.200+1Sterne-Änderung der letzten 7 Tage - #50
Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.
★ 1.176-22Sterne-Änderung der letzten 7 Tage - #51
NCalc ist eine schnelle und leichtgewichtige Expressions-Auswertung-Bibliothek für .NET, die auf Flexibilität und hohe Leistung ausgelegt ist. Sie unterstützt eine Vielzahl mathematischer und logischer Operationen.
★ 1.156+2Sterne-Änderung der letzten 7 Tage - #52★ 1.155+7Sterne-Änderung der letzten 7 Tage
- #53
Bewerten Sie die Antworten Ihres LLM mit Prometheus und GPT4 💯
★ 1.111+4Sterne-Änderung der letzten 7 Tage - #54
LangSmith Client SDK-Implementierungen
★ 1.049+9Sterne-Änderung der letzten 7 Tage - #55
SemanticKITTI-API zur Visualisierung von Datensätzen, Verarbeitung von Daten und Auswertung von Ergebnissen.
★ 898+3Sterne-Änderung der letzten 7 Tage - #56
Generierung hochwertiger synthetischer Daten sowie Training, Messung und Evaluierung in einer einzigen Pipeline
★ 885+3Sterne-Änderung der letzten 7 Tage - #57
ClawProBench ist ein Live-First-Benchmark-Harness zur Evaluierung von LLM-Agenten in der OpenClaw-Laufzeitumgebung mit deterministischer Bewertung und Zuverlässigkeit bei wiederholten Durchläufen.
★ 823+0Sterne-Änderung der letzten 7 Tage - #58
OpenJudge: Ein einheitliches Framework für ganzheitliche Evaluierung und Qualitätsbelohnungen
★ 819+14Sterne-Änderung der letzten 7 Tage - #59★ 814+1Sterne-Änderung der letzten 7 Tage
- #60
Web Codegen Scorer ist ein Werkzeug zur Bewertung der Qualität von Web-Code, der von LLMs generiert wurde.
★ 775+4Sterne-Änderung der letzten 7 Tage