benchmark
Erfasste Open-Source-Repos mit dem Tag benchmark, sortiert nach Sternen.
- #121
Punktbasierter und winziger Code-Satz zur Objekterkennung und -lokalisierung von UCAS-VG
★ 694+1Sterne-Änderung der letzten 7 Tage - #122
Benchmarking der Langform-Faktizität in Large Language Models. Originalcode für unser Paper „Long-form factuality in large language models“.
★ 693+2Sterne-Änderung der letzten 7 Tage - #123
Ein Benchmarking-Framework für die Programmiersprache Julia
★ 683+0Sterne-Änderung der letzten 7 Tage - #124
Dieses Repository enthält den Code für „VLM2Vec / MMEB“ [ICLR 2025], „VLM2Vec-V2 / MMEB-V2“ [TMLR 2026] und „MMEB-V3“ [COLM 2026].
★ 682+2Sterne-Änderung der letzten 7 Tage - #125★ 664+54Sterne-Änderung der letzten 7 Tage
- #126
CAIRI Toolbox und Benchmark für überwachtes, semi-überwachtes und selbstüberwachtes visuelles Repräsentations lernen
★ 658+0Sterne-Änderung der letzten 7 Tage - #127
Awesome-LLM-Eval: eine kuratierte Liste von Tools, Datensätzen/Benchmarks, Demos, Bestenlisten, Papers, Dokumenten und Modellen, hauptsächlich zur Evaluierung von LLMs.
★ 656-2Sterne-Änderung der letzten 7 Tage - #128
BenchMARL ist eine Bibliothek für Benchmarking im Bereich Multi-Agent Reinforcement Learning (MARL). BenchMARL ermöglicht den schnellen Vergleich verschiedener MARL-Algorithmen, -Aufgaben und -Modelle, gestützt auf die zwei Kernprinzipien: Reproduzierbarkeit und Standardisierung.
★ 656+2Sterne-Änderung der letzten 7 Tage - #129
Der allererste umfangreiche Benchmark für die indonesische Sprache im Bereich der natürlichen Sprachverarbeitung. Wir bieten mehrere Downstream-Aufgaben, vortrainierte IndoBERT-Modelle und Startcode! (AACL-IJCNLP 2020)
★ 655+1Sterne-Änderung der letzten 7 Tage - #130
Eine Sammlung ziemlich cooler Datensätze für die Netzwerk- und Machine-Learning-Forschung.
★ 655+0Sterne-Änderung der letzten 7 Tage - #131
A.S.E (AICGSecEval) ist ein von Tencent Wukong Code Security Team entwickeltes Benchmark zur Bewertung der Sicherheit von KI-generiertem Code auf Repository-Ebene.
★ 655+0Sterne-Änderung der letzten 7 Tage - #132
Kotlin Multiplatform Benchmarking-Toolkit.
★ 644+0Sterne-Änderung der letzten 7 Tage - #133★ 632+2Sterne-Änderung der letzten 7 Tage
- #134
AgentLab: Ein Open-Source-Framework zur Entwicklung, zum Testen und zum Benchmarking von Web-Agenten für verschiedene Aufgaben, ausgelegt auf Skalierbarkeit und Reproduzierbarkeit.
★ 629+1Sterne-Änderung der letzten 7 Tage - #135
Federated Learning Benchmark - Föderiertes Lernen auf Non-IID-Datensilos: Eine experimentelle Studie (ICDE 2022)
★ 618+0Sterne-Änderung der letzten 7 Tage - #136
Leistungstest-Matcher für RSpec.
★ 618+0Sterne-Änderung der letzten 7 Tage - #137
Ein Benchmark für Textklassifizierung in PyTorch
★ 608+0Sterne-Änderung der letzten 7 Tage - #138★ 604+0Sterne-Änderung der letzten 7 Tage
- #139
Ein globales Netzwerk von Sonden zur Durchführung von Netzwerktests wie Ping, Traceroute und DNS-Auflösung.
★ 597+3Sterne-Änderung der letzten 7 Tage - #140
Visuelle Objektverfolgung
★ 596+1Sterne-Änderung der letzten 7 Tage - #141
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594—Sterne-Änderung der letzten 7 Tage - #142
Ein moderner HTTP-Framework-Bencher, der HTTP/1- und HTTP/2-Benchmarks unterstützt.
★ 588+2Sterne-Änderung der letzten 7 Tage - #143★ 580+1Sterne-Änderung der letzten 7 Tage
- #144
ParseBench - Ein Dokumenten-Parsing-Benchmark für KI-Agenten
★ 565+10Sterne-Änderung der letzten 7 Tage - #145
In C++17 geschriebene Serialisierungsbibliothek – packt C++-Structs ohne Makros oder Boilerplate-Code in kompakte Byte-Arrays.
★ 560+0Sterne-Änderung der letzten 7 Tage - #146
Einfacher Leistungsvergleich verschiedener Programmiersprachen (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)
★ 557+1Sterne-Änderung der letzten 7 Tage - #147
SpeechIO Leaderboard: eine große, robuste und umfassende Benchmarking-Plattform für automatische Spracherkennung.
★ 553+3Sterne-Änderung der letzten 7 Tage - #148
Meta Agents Research Environments ist eine umfassende Plattform zur Evaluierung von KI-Agenten in dynamischen, realistischen Szenarien. Im Gegensatz zu statischen Benchmarks bietet diese Plattform sich entwickelnde Umgebungen, in denen Agenten ihre Strategien bei neuen Informationen anpassen müssen, um reale Herausforderungen abzubilden.
★ 550+3Sterne-Änderung der letzten 7 Tage - #149
Datensatz und Benchmark für RAG auf internen Unternehmensdokumenten.
★ 545+8Sterne-Änderung der letzten 7 Tage - #150★ 540+0Sterne-Änderung der letzten 7 Tage