Zum Hauptinhalt springen
buildradar
Sign in
Thema · evaluation

evaluation

Erfasste Open-Source-Repos mit dem Tag evaluation, sortiert nach Sternen.

80 Repos
  • evaluation-guidebook@huggingface

    Teilen von praktischen Einblicken und theoretischem Wissen zur LLM-Evaluierung, die wir bei der Verwaltung des Open LLM Leaderboards und der Entwicklung von lighteval gesammelt haben!

    2.143+2Sterne-Änderung der letzten 7 Tage
  • avalanche@ContinualAI

    Avalanche: Eine End-to-End-Bibliothek für Continual Learning auf Basis von PyTorch

    2.088+0Sterne-Änderung der letzten 7 Tage
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Evaluierung des State of the Art in der KI

    2.037-2Sterne-Änderung der letzten 7 Tage
  • alpaca_eval@tatsu-lab

    Ein automatischer Evaluator für anweisungsbefolgende Sprachmodelle. Von Menschen validiert, qualitativ hochwertig, günstig und schnell.

    2.012-1Sterne-Änderung der letzten 7 Tage
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) Offizielle Python-Implementierung für „3D Multi-Object Tracking: A Baseline and New Evaluation Metrics“

    1.846+0Sterne-Änderung der letzten 7 Tage
  • WFGY@onestardao

    WFGY steuert auf das WFGY 5.0 Polaris Protocol zu, ein großes Open-Source-Release für KI-Reasoning, RAG, Agenten und reale Workflows. Enthält Problem Map, Global Debug Card, WFGY 4.0 und das CFV Easter Egg.

    1.786+1Sterne-Änderung der letzten 7 Tage
  • EmoLLM@SmartFlowAI

    Großes Sprachmodell für psychische Gesundheit (LLM x Mental Health), Pre- & Post-Training, Datensatz, Evaluierung, Bereitstellung & RAG, kompatibel mit den Serien InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLaMA und GLM.

    1.781+1Sterne-Änderung der letzten 7 Tage
  • trpc-agent-go@trpc-group

    Ein Go-Framework zum Erstellen von produktionsreifen Agentensystemen mit Graph-Workflows, Tools, Speicher, A2A, AG-UI, MCP, Evaluierung und Observability.

    1.760+12Sterne-Änderung der letzten 7 Tage
  • ragbits@deepsense-ai

    Bausteine für die schnelle Entwicklung von GenAI-Anwendungen

    1.668+0Sterne-Änderung der letzten 7 Tage
  • Die offizielle GitHub-Seite für das Survey-Paper „A Survey on Evaluation of Large Language Models“.

    1.608-1Sterne-Änderung der letzten 7 Tage
  • pycm@sepandhaghighi

    Bibliothek für Mehrklassen-Konfusionsmatrizen in Python

    1.506+0Sterne-Änderung der letzten 7 Tage
  • nlg-eval@Maluuba

    Evaluierungscode für verschiedene unüberwachte automatisierte Metriken zur natürlichen Sprachgenerierung (NLG).

    1.391+0Sterne-Änderung der letzten 7 Tage
  • lispy@abo-abo

    Kompakte und elegante LISP-Bearbeitung

    1.300+0Sterne-Änderung der letzten 7 Tage
  • xai@EthicalML

    XAI - Eine Explainability-Toolbox für maschinelles Lernen

    1.260+0Sterne-Änderung der letzten 7 Tage
  • intellagent@plurai-ai

    Ein Framework zur umfassenden Diagnose und Optimierung von Agenten anhand simulierter, realistischer synthetischer Interaktionen

    1.257+0Sterne-Änderung der letzten 7 Tage
  • KernelBench@ScalingIntelligence

    KernelBench: Können LLMs GPU-Kernel schreiben? – Benchmark + Toolkit mit Torch -> CUDA (+ weitere DSLs)

    1.227+7Sterne-Änderung der letzten 7 Tage
  • kubetorch@run-house

    KI-Workloads in Python magisch auf Kubernetes verteilen und ausführen, wie PyTorch für ML-Infra.

    1.224+0Sterne-Änderung der letzten 7 Tage
  • fuzzbench@google

    FuzzBench – Fuzzer-Benchmarking als Service.

    1.206+0Sterne-Änderung der letzten 7 Tage
  • torch-fidelity@toshas

    High-Fidelity-Leistungsmetriken für generative Modelle in PyTorch

    1.200+1Sterne-Änderung der letzten 7 Tage
  • Tracely-ai@Jwuthri

    Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.

    1.176-22Sterne-Änderung der letzten 7 Tage
  • ncalc@ncalc

    NCalc ist eine schnelle und leichtgewichtige Expressions-Auswertung-Bibliothek für .NET, die auf Flexibilität und hohe Leistung ausgelegt ist. Sie unterstützt eine Vielzahl mathematischer und logischer Operationen.

    1.156+2Sterne-Änderung der letzten 7 Tage
  • Gym@NVIDIA-NeMo

    Modelle und Agenten mithilfe von Umgebungen evaluieren und verbessern

    1.155+7Sterne-Änderung der letzten 7 Tage
  • prometheus-eval@prometheus-eval

    Bewerten Sie die Antworten Ihres LLM mit Prometheus und GPT4 💯

    1.111+4Sterne-Änderung der letzten 7 Tage
  • langsmith-sdk@langchain-ai

    LangSmith Client SDK-Implementierungen

    1.049+9Sterne-Änderung der letzten 7 Tage
  • SemanticKITTI-API zur Visualisierung von Datensätzen, Verarbeitung von Daten und Auswertung von Ergebnissen.

    898+3Sterne-Änderung der letzten 7 Tage
  • deepfabric@nolabs-ai

    Generierung hochwertiger synthetischer Daten sowie Training, Messung und Evaluierung in einer einzigen Pipeline

    885+3Sterne-Änderung der letzten 7 Tage
  • ClawProBench@suyoumo

    ClawProBench ist ein Live-First-Benchmark-Harness zur Evaluierung von LLM-Agenten in der OpenClaw-Laufzeitumgebung mit deterministischer Bewertung und Zuverlässigkeit bei wiederholten Durchläufen.

    823+0Sterne-Änderung der letzten 7 Tage
  • OpenJudge@agentscope-ai

    OpenJudge: Ein einheitliches Framework für ganzheitliche Evaluierung und Qualitätsbelohnungen

    819+14Sterne-Änderung der letzten 7 Tage
  • gval@PaesslerAG

    Ausdrucksauswertung in Golang

    814+1Sterne-Änderung der letzten 7 Tage
  • web-codegen-scorer@angular

    Web Codegen Scorer ist ein Werkzeug zur Bewertung der Qualität von Web-Code, der von LLMs generiert wurde.

    775+4Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen