evaluation
Erfasste Open-Source-Repos mit dem Tag evaluation, sortiert nach Sternen.
- #61★ 768+0Sterne-Änderung der letzten 7 Tage
- #62
[EMNLP 2024 & AAAI 2026] Ein leistungsstarkes Toolkit zur Komprimierung großer Modelle einschließlich LLMs, VLMs und Video-Generierungsmodellen.
★ 747+4Sterne-Änderung der letzten 7 Tage - #63
🦞 Offizielles Plugin für OpenClaw, das Agenten-Traces nach Opik exportiert. Überwachen Sie Agentenverhalten, Kosten, Token, Fehler und mehr.
★ 725+0Sterne-Änderung der letzten 7 Tage - #64
Python-Implementierung des IOU Trackers
★ 702+0Sterne-Änderung der letzten 7 Tage - #65
⚡️Eine blitzschnelle Python-Bibliothek für Ranking-Evaluierung, -Vergleich und -Fusion 🐍
★ 697+4Sterne-Änderung der letzten 7 Tage - #66
Benchmarking der Langform-Faktizität in Large Language Models. Originalcode für unser Paper „Long-form factuality in large language models“.
★ 693+2Sterne-Änderung der letzten 7 Tage - #67★ 664+54Sterne-Änderung der letzten 7 Tage
- #68
Awesome-LLM-Eval: eine kuratierte Liste von Tools, Datensätzen/Benchmarks, Demos, Bestenlisten, Papers, Dokumenten und Modellen, hauptsächlich zur Evaluierung von LLMs.
★ 656-2Sterne-Änderung der letzten 7 Tage - #69
AutoPrompt: Automatische Prompt-Erstellung für maskierte Sprachmodelle.
★ 641+0Sterne-Änderung der letzten 7 Tage - #70★ 632+2Sterne-Änderung der letzten 7 Tage
- #71
Ein einfacher Mathe- und Pseudo-C#-Expression-Evaluator in einer C#-Datei. Kann auch kleine C#-ähnliche Skripte ausführen
★ 630+0Sterne-Änderung der letzten 7 Tage - #72
Ein Ressourcen-Repository für Machine Unlearning in Large Language Models
★ 623+0Sterne-Änderung der letzten 7 Tage - #73
TCExam ist ein computerbasiertes Bewertungssystem (CBA) für Universitäten, Schulen und Unternehmen, mit dem Lehrende und Ausbilder Umfragen, Quizze, Tests und Prüfungen erstellen, planen, durchführen und auswerten können.
★ 619+0Sterne-Änderung der letzten 7 Tage - #74
Einfacher, sicherer, in einer Sandbox ausgeführter und erweiterbarer Ausdrucksauswerter für Python
★ 611+0Sterne-Änderung der letzten 7 Tage - #75
Eine Toolbox zur Evaluierung verschiedener Methoden für das Image Matching basierend auf Bildpaaren.
★ 594+0Sterne-Änderung der letzten 7 Tage - #76
Dieses Repository enthält Evaluierungscode für das Paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 593+1Sterne-Änderung der letzten 7 Tage - #77
Eine Sammlung von Datensätzen, die Fragen mit SQL-Abfragen verknüpfen.
★ 588+1Sterne-Änderung der letzten 7 Tage - #78
ParseBench - Ein Dokumenten-Parsing-Benchmark für KI-Agenten
★ 565+10Sterne-Änderung der letzten 7 Tage - #79
Meta Agents Research Environments ist eine umfassende Plattform zur Evaluierung von KI-Agenten in dynamischen, realistischen Szenarien. Im Gegensatz zu statischen Benchmarks bietet diese Plattform sich entwickelnde Umgebungen, in denen Agenten ihre Strategien bei neuen Informationen anpassen müssen, um reale Herausforderungen abzubilden.
★ 550+3Sterne-Änderung der letzten 7 Tage - #80
Datensatz und Benchmark für RAG auf internen Unternehmensdokumenten.
★ 545+8Sterne-Änderung der letzten 7 Tage