evaluation
Erfasste Open-Source-Repos mit dem Tag evaluation, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit evaluation am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit evaluation getaggt wurden.
- #1
Der Fable-Workflow: Wie Claude Fable 5 funktionierte, verdichtet zu Fähigkeiten, die jedes Modell ausführen kann, zusammen mit der Evaluierung, die es ehrlich hält. Denken / Handeln / Beweisen.
★ 2.267 - #2
Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.
★ 1.159 - #3
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 Open-Source-KI-Ingenieurplattform: LLM-Evaluierungen, Beobachtbarkeit, Metriken, Prompt-Management, Playground, Datensätze. Integriert mit OpenTelemetry, LangChain, OpenAI SDK, LiteLLM und mehr. 🍊YC W23
★ 33.909+372Sterne-Änderung der letzten 7 Tage - #2
Die Open‑Source‑KI‑Engineering‑Plattform für Agenten, Large Language Models und ML‑Modelle. MLflow ermöglicht Teams aller Größenordnungen, Produktions‑Qualitäts‑KI‑Anwendungen zu debuggen, zu bewerten, zu überwachen und zu optimieren, während Kosten kontrolliert und der Zugriff auf Modelle und Daten verwaltet wird.
★ 27.728+114Sterne-Änderung der letzten 7 Tage - #3
Testen Sie Ihre Prompts, Agents und RAGs. Red Teaming/Pentesting/Vulnerability-Scanning für KI. Leistungsvergleich von GPT, Claude, Gemini, DeepSeek und mehr. Einfache deklarative Konfigurationen mit Kommandozeile und CI/CD-Integration. Von OpenAI und Anthropic genutzt.
★ 24.664+215Sterne-Änderung der letzten 7 Tage - #4
Debuggen, bewerten und überwachen Sie Ihre LLM-Anwendungen, RAG-Systeme und agentenbasierten Workflows mit umfassender Nachverfolgung, automatisierten Evaluierungen und produktionsreifen Dashboards.
★ 21.668+143Sterne-Änderung der letzten 7 Tage - #5
Open-Source-LLM-Wissensplattform: Verwandeln Sie Rohdokumente in ein abfragbares RAG, einen autonomen Reasoning-Agenten und ein sich selbst wartendes Wiki.
★ 20.899+581Sterne-Änderung der letzten 7 Tage - #6★ 15.541+123Sterne-Änderung der letzten 7 Tage
- #7
Einfaches Fine-Tuning, Evaluierung und Deployment von Qwen, Gemma oder anderen Open-Weight-LLMs!
★ 9.380+3Sterne-Änderung der letzten 7 Tage - #8
OpenCompass ist eine LLM-Evaluierungsplattform, die eine Vielzahl von Modellen (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude usw.) auf über 100 Datensätzen unterstützt.
★ 7.374+48Sterne-Änderung der letzten 7 Tage - #9
🧊 Open-Source-LLM-Observability-Plattform. Eine Zeile Code zum Überwachen, Auswerten und Experimentieren. YC W23 🍓
★ 6.116+23Sterne-Änderung der letzten 7 Tage - #10
KI-Agent-Optimierungsplattform der nächsten Generation: Cozeloop adressiert Herausforderungen bei der Entwicklung von KI-Agenten durch die Bereitstellung von Funktionen für das gesamte Lebenszyklusmanagement von der Entwicklung über das Debugging und die Evaluierung bis hin zur Überwachung.
★ 5.706+7Sterne-Änderung der letzten 7 Tage - #11
AutoRAG: Jetzt kann Ihr Agent alles auf Ihrem Computer finden. Er wird intelligenter, je häufiger Sie ihn nutzen.
★ 5.057+7Sterne-Änderung der letzten 7 Tage - #12
KI-Systeme entwickeln, bewerten und optimieren. Beinhaltet Evaluierungen, RAG, Agenten, Fine-Tuning, synthetische Datenerzeugung, Dataset-Management, MCP und mehr.
★ 5.037+7Sterne-Änderung der letzten 7 Tage - #13
All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben
★ 4.383+11Sterne-Änderung der letzten 7 Tage - #14
Open-Source-Evaluierungs-Toolkit für Large Multi-Modality Models (LMMs), unterstützt über 220 LMMs und 80+ Benchmarks
★ 4.362+10Sterne-Änderung der letzten 7 Tage - #15★ 4.310+7Sterne-Änderung der letzten 7 Tage
- #16★ 3.517+13Sterne-Änderung der letzten 7 Tage
- #17
MTEB: State-of-the-Art-Evaluierung von Embeddings über Sprachen und Modalitäten hinweg
★ 3.409+9Sterne-Änderung der letzten 7 Tage - #18
Ein schlankes und anpassbares Framework für die effiziente Evaluierung und Leistungsbenchmarking großer Modelle (LLM, VLM, AIGC).
★ 3.331+47Sterne-Änderung der letzten 7 Tage - #19
SuperCLUE: Ein umfassender Benchmark für chinesische Universal-Foundation-Modelle | A Benchmark for Foundation Models in Chinese
★ 3.299-1Sterne-Änderung der letzten 7 Tage - #20
Laminar – eine Open-Source-Observability-Plattform, speziell entwickelt für KI-Agenten. YC S24.
★ 3.210+24Sterne-Änderung der letzten 7 Tage - #21
Klipse ist ein JavaScript-Plugin zum Einbinden interaktiver Code-Snippets in Tech-Blogs.
★ 3.134+0Sterne-Änderung der letzten 7 Tage - #22
Eine Open-Source-Umgebung für visuelle Programmierung zum Praxistest von Prompts für LLMs.
★ 3.028+1Sterne-Änderung der letzten 7 Tage - #23
YAO = Yielding AI Outcomes. Ein rigoroses Engineering-, Evaluierungs-, Governance- und Portabilitätssystem für wiederverwendbare Agenten-Fähigkeiten.
★ 2.557+160Sterne-Änderung der letzten 7 Tage - #24
Lighteval ist Ihr All-in-One-Toolkit zur Evaluierung von LLMs über mehrere Backends hinweg
★ 2.530+8Sterne-Änderung der letzten 7 Tage - #25
🤗 Evaluate: Eine Bibliothek zur einfachen Evaluierung von Machine-Learning-Modellen und Datensätzen.
★ 2.480+2Sterne-Änderung der letzten 7 Tage - #26
UpTrain ist eine einheitliche Open-Source-Plattform zur Evaluierung und Verbesserung von Generative-AI-Anwendungen. Wir bieten Bewertungen für über 20 vorkonfigurierte Prüfungen (für Sprach-, Code- und Embedding-Anwendungsfälle), führen Ursachenanalysen bei Fehlern durch und geben Einblicke in deren Behebung.
★ 2.364+3Sterne-Änderung der letzten 7 Tage - #27
Vollständiges RAG: Integriert GraphRAG, LightRAG und Neo4j-llm-graph-builder für den Aufbau und die Suche von Wissensgraphen. Kombiniert DeepSearch-Technologie für privates RAG-Reasoning und bietet ein eigenes Evaluierungsframework für GraphRAG.
★ 2.330+8Sterne-Änderung der letzten 7 Tage - #28
Der Fable-Workflow: Wie Claude Fable 5 funktionierte, verdichtet zu Fähigkeiten, die jedes Modell ausführen kann, zusammen mit der Evaluierung, die es ehrlich hält. Denken / Handeln / Beweisen.
★ 2.267+23Sterne-Änderung der letzten 7 Tage - #29
Test- und Evaluierungsplattform zum Chatten, Inspizieren und Debuggen von MCP-Servern, MCP-Apps und ChatGPT-Apps.
★ 2.177+23Sterne-Änderung der letzten 7 Tage - #30
📰 Lesenswerte Paper und Blogs zur LLM-basierten Langkontext-Modellierung 🔥
★ 2.165+2Sterne-Änderung der letzten 7 Tage