Zum Hauptinhalt springen
buildradar
Sign in
Thema · evaluation

evaluation

Erfasste Open-Source-Repos mit dem Tag evaluation, sortiert nach Sternen.

Repos
80
Sterne gesamt
291.588
Sterne im Schnitt
3.645
Anteil
0,02%

Themen, die häufig gemeinsam mit evaluation am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit evaluation getaggt wurden.

  • fable-method@Sahir619

    Der Fable-Workflow: Wie Claude Fable 5 funktionierte, verdichtet zu Fähigkeiten, die jedes Modell ausführen kann, zusammen mit der Evaluierung, die es ehrlich hält. Denken / Handeln / Beweisen.

    2.267
  • Tracely-ai@Jwuthri

    Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.

    1.159
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 Open-Source-KI-Ingenieurplattform: LLM-Evaluierungen, Beobachtbarkeit, Metriken, Prompt-Management, Playground, Datensätze. Integriert mit OpenTelemetry, LangChain, OpenAI SDK, LiteLLM und mehr. 🍊YC W23

    33.909+372Sterne-Änderung der letzten 7 Tage
  • mlflow@mlflow

    Die Open‑Source‑KI‑Engineering‑Plattform für Agenten, Large Language Models und ML‑Modelle. MLflow ermöglicht Teams aller Größenordnungen, Produktions‑Qualitäts‑KI‑Anwendungen zu debuggen, zu bewerten, zu überwachen und zu optimieren, während Kosten kontrolliert und der Zugriff auf Modelle und Daten verwaltet wird.

    27.728+114Sterne-Änderung der letzten 7 Tage
  • promptfoo@promptfoo

    Testen Sie Ihre Prompts, Agents und RAGs. Red Teaming/Pentesting/Vulnerability-Scanning für KI. Leistungsvergleich von GPT, Claude, Gemini, DeepSeek und mehr. Einfache deklarative Konfigurationen mit Kommandozeile und CI/CD-Integration. Von OpenAI und Anthropic genutzt.

    24.664+215Sterne-Änderung der letzten 7 Tage
  • opik@comet-ml

    Debuggen, bewerten und überwachen Sie Ihre LLM-Anwendungen, RAG-Systeme und agentenbasierten Workflows mit umfassender Nachverfolgung, automatisierten Evaluierungen und produktionsreifen Dashboards.

    21.668+143Sterne-Änderung der letzten 7 Tage
  • WeKnora@Tencent

    Open-Source-LLM-Wissensplattform: Verwandeln Sie Rohdokumente in ein abfragbares RAG, einen autonomen Reasoning-Agenten und ein sich selbst wartendes Wiki.

    20.899+581Sterne-Änderung der letzten 7 Tage
  • ragas@vibrantlabsai

    Beschleunigen Sie Ihre LLM-Anwendungsbewertungen

    15.541+123Sterne-Änderung der letzten 7 Tage
  • oumi@oumi-ai

    Einfaches Fine-Tuning, Evaluierung und Deployment von Qwen, Gemma oder anderen Open-Weight-LLMs!

    9.380+3Sterne-Änderung der letzten 7 Tage
  • opencompass@open-compass

    OpenCompass ist eine LLM-Evaluierungsplattform, die eine Vielzahl von Modellen (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude usw.) auf über 100 Datensätzen unterstützt.

    7.374+48Sterne-Änderung der letzten 7 Tage
  • helicone@Helicone

    🧊 Open-Source-LLM-Observability-Plattform. Eine Zeile Code zum Überwachen, Auswerten und Experimentieren. YC W23 🍓

    6.116+23Sterne-Änderung der letzten 7 Tage
  • coze-loop@coze-dev

    KI-Agent-Optimierungsplattform der nächsten Generation: Cozeloop adressiert Herausforderungen bei der Entwicklung von KI-Agenten durch die Bereitstellung von Funktionen für das gesamte Lebenszyklusmanagement von der Entwicklung über das Debugging und die Evaluierung bis hin zur Überwachung.

    5.706+7Sterne-Änderung der letzten 7 Tage
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: Jetzt kann Ihr Agent alles auf Ihrem Computer finden. Er wird intelligenter, je häufiger Sie ihn nutzen.

    5.057+7Sterne-Änderung der letzten 7 Tage
  • Kiln@Kiln-AI

    KI-Systeme entwickeln, bewerten und optimieren. Beinhaltet Evaluierungen, RAG, Agenten, Fine-Tuning, synthetische Datenerzeugung, Dataset-Management, MCP und mehr.

    5.037+7Sterne-Änderung der letzten 7 Tage
  • lmms-eval@EvolvingLMMs-Lab

    All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben

    4.383+11Sterne-Änderung der letzten 7 Tage
  • VLMEvalKit@open-compass

    Open-Source-Evaluierungs-Toolkit für Large Multi-Modality Models (LMMs), unterstützt über 220 LMMs und 80+ Benchmarks

    4.362+10Sterne-Änderung der letzten 7 Tage
  • evo@MichaelGrupp

    Python-Paket zur Evaluierung von Odometrie und SLAM

    4.310+7Sterne-Änderung der letzten 7 Tage
  • langwatch@langwatch

    Die Plattform für LLM-Evaluierungen und KI-Agenten-Tests

    3.517+13Sterne-Änderung der letzten 7 Tage
  • mteb@embeddings-benchmark

    MTEB: State-of-the-Art-Evaluierung von Embeddings über Sprachen und Modalitäten hinweg

    3.409+9Sterne-Änderung der letzten 7 Tage
  • evalscope@modelscope

    Ein schlankes und anpassbares Framework für die effiziente Evaluierung und Leistungsbenchmarking großer Modelle (LLM, VLM, AIGC).

    3.331+47Sterne-Änderung der letzten 7 Tage
  • SuperCLUE@CLUEbenchmark

    SuperCLUE: Ein umfassender Benchmark für chinesische Universal-Foundation-Modelle | A Benchmark for Foundation Models in Chinese

    3.299-1Sterne-Änderung der letzten 7 Tage
  • lmnr@lmnr-ai

    Laminar – eine Open-Source-Observability-Plattform, speziell entwickelt für KI-Agenten. YC S24.

    3.210+24Sterne-Änderung der letzten 7 Tage
  • klipse@viebel

    Klipse ist ein JavaScript-Plugin zum Einbinden interaktiver Code-Snippets in Tech-Blogs.

    3.134+0Sterne-Änderung der letzten 7 Tage
  • ChainForge@ianarawjo

    Eine Open-Source-Umgebung für visuelle Programmierung zum Praxistest von Prompts für LLMs.

    3.028+1Sterne-Änderung der letzten 7 Tage
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes. Ein rigoroses Engineering-, Evaluierungs-, Governance- und Portabilitätssystem für wiederverwendbare Agenten-Fähigkeiten.

    2.557+160Sterne-Änderung der letzten 7 Tage
  • lighteval@huggingface

    Lighteval ist Ihr All-in-One-Toolkit zur Evaluierung von LLMs über mehrere Backends hinweg

    2.530+8Sterne-Änderung der letzten 7 Tage
  • evaluate@huggingface

    🤗 Evaluate: Eine Bibliothek zur einfachen Evaluierung von Machine-Learning-Modellen und Datensätzen.

    2.480+2Sterne-Änderung der letzten 7 Tage
  • uptrain@uptrain-ai

    UpTrain ist eine einheitliche Open-Source-Plattform zur Evaluierung und Verbesserung von Generative-AI-Anwendungen. Wir bieten Bewertungen für über 20 vorkonfigurierte Prüfungen (für Sprach-, Code- und Embedding-Anwendungsfälle), führen Ursachenanalysen bei Fehlern durch und geben Einblicke in deren Behebung.

    2.364+3Sterne-Änderung der letzten 7 Tage
  • graph-rag-agent@1517005260

    Vollständiges RAG: Integriert GraphRAG, LightRAG und Neo4j-llm-graph-builder für den Aufbau und die Suche von Wissensgraphen. Kombiniert DeepSearch-Technologie für privates RAG-Reasoning und bietet ein eigenes Evaluierungsframework für GraphRAG.

    2.330+8Sterne-Änderung der letzten 7 Tage
  • fable-method@Sahir619

    Der Fable-Workflow: Wie Claude Fable 5 funktionierte, verdichtet zu Fähigkeiten, die jedes Modell ausführen kann, zusammen mit der Evaluierung, die es ehrlich hält. Denken / Handeln / Beweisen.

    2.267+23Sterne-Änderung der letzten 7 Tage
  • inspector@MCPJam

    Test- und Evaluierungsplattform zum Chatten, Inspizieren und Debuggen von MCP-Servern, MCP-Apps und ChatGPT-Apps.

    2.177+23Sterne-Änderung der letzten 7 Tage
  • 📰 Lesenswerte Paper und Blogs zur LLM-basierten Langkontext-Modellierung 🔥

    2.165+2Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen