Zum Hauptinhalt springen
buildradar
Sign in
Thema · benchmark

benchmark

Erfasste Open-Source-Repos mit dem Tag benchmark, sortiert nach Sternen.

158 Repos
  • PointTinyBenchmark@ucas-vg

    Punktbasierter und winziger Code-Satz zur Objekterkennung und -lokalisierung von UCAS-VG

    694+1Sterne-Änderung der letzten 7 Tage
  • long-form-factuality@google-deepmind

    Benchmarking der Langform-Faktizität in Large Language Models. Originalcode für unser Paper „Long-form factuality in large language models“.

    693+2Sterne-Änderung der letzten 7 Tage
  • Ein Benchmarking-Framework für die Programmiersprache Julia

    683+0Sterne-Änderung der letzten 7 Tage
  • VLM2Vec@TIGER-AI-Lab

    Dieses Repository enthält den Code für „VLM2Vec / MMEB“ [ICLR 2025], „VLM2Vec-V2 / MMEB-V2“ [TMLR 2026] und „MMEB-V3“ [COLM 2026].

    682+2Sterne-Änderung der letzten 7 Tage
  • ClawBench@TIGER-AI-Lab

    Open-Source-Benchmark für Browser-KI-Agenten bei alltäglichen Aufgaben.

    664+54Sterne-Änderung der letzten 7 Tage
  • openmixup@Westlake-AI

    CAIRI Toolbox und Benchmark für überwachtes, semi-überwachtes und selbstüberwachtes visuelles Repräsentations lernen

    658+0Sterne-Änderung der letzten 7 Tage
  • Awesome-LLM-Eval: eine kuratierte Liste von Tools, Datensätzen/Benchmarks, Demos, Bestenlisten, Papers, Dokumenten und Modellen, hauptsächlich zur Evaluierung von LLMs.

    656-2Sterne-Änderung der letzten 7 Tage
  • BenchMARL@facebookresearch

    BenchMARL ist eine Bibliothek für Benchmarking im Bereich Multi-Agent Reinforcement Learning (MARL). BenchMARL ermöglicht den schnellen Vergleich verschiedener MARL-Algorithmen, -Aufgaben und -Modelle, gestützt auf die zwei Kernprinzipien: Reproduzierbarkeit und Standardisierung.

    656+2Sterne-Änderung der letzten 7 Tage
  • indonlu@IndoNLP

    Der allererste umfangreiche Benchmark für die indonesische Sprache im Bereich der natürlichen Sprachverarbeitung. Wir bieten mehrere Downstream-Aufgaben, vortrainierte IndoBERT-Modelle und Startcode! (AACL-IJCNLP 2020)

    655+1Sterne-Änderung der letzten 7 Tage
  • datasets@benedekrozemberczki

    Eine Sammlung ziemlich cooler Datensätze für die Netzwerk- und Machine-Learning-Forschung.

    655+0Sterne-Änderung der letzten 7 Tage
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) ist ein von Tencent Wukong Code Security Team entwickeltes Benchmark zur Bewertung der Sicherheit von KI-generiertem Code auf Repository-Ebene.

    655+0Sterne-Änderung der letzten 7 Tage
  • Kotlin Multiplatform Benchmarking-Toolkit.

    644+0Sterne-Änderung der letzten 7 Tage
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Vertrauenswürdigkeit in Large Language Models

    632+2Sterne-Änderung der letzten 7 Tage
  • AgentLab@ServiceNow

    AgentLab: Ein Open-Source-Framework zur Entwicklung, zum Testen und zum Benchmarking von Web-Agenten für verschiedene Aufgaben, ausgelegt auf Skalierbarkeit und Reproduzierbarkeit.

    629+1Sterne-Änderung der letzten 7 Tage
  • NIID-Bench@Xtra-Computing

    Federated Learning Benchmark - Föderiertes Lernen auf Non-IID-Datensilos: Eine experimentelle Studie (ICDE 2022)

    618+0Sterne-Änderung der letzten 7 Tage
  • rspec-benchmark@piotrmurach

    Leistungstest-Matcher für RSpec.

    618+0Sterne-Änderung der letzten 7 Tage
  • TextClassificationBenchmark@FreedomIntelligence

    Ein Benchmark für Textklassifizierung in PyTorch

    608+0Sterne-Änderung der letzten 7 Tage
  • KLUE@KLUE-benchmark

    📖 Korean NLU Benchmark

    604+0Sterne-Änderung der letzten 7 Tage
  • globalping@jsdelivr

    Ein globales Netzwerk von Sonden zur Durchführung von Netzwerktests wie Ping, Traceroute und DNS-Auflösung.

    597+3Sterne-Änderung der letzten 7 Tage
  • Visuelle Objektverfolgung

    596+1Sterne-Änderung der letzten 7 Tage
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594Sterne-Änderung der letzten 7 Tage
  • rewrk@lnx-search

    Ein moderner HTTP-Framework-Bencher, der HTTP/1- und HTTP/2-Benchmarks unterstützt.

    588+2Sterne-Änderung der letzten 7 Tage
  • CL-bench@Tencent-Hunyuan

    CL-bench: Ein Benchmark für Context Learning

    580+1Sterne-Änderung der letzten 7 Tage
  • ParseBench@run-llama

    ParseBench - Ein Dokumenten-Parsing-Benchmark für KI-Agenten

    565+10Sterne-Änderung der letzten 7 Tage
  • alpaca@p-ranav

    In C++17 geschriebene Serialisierungsbibliothek – packt C++-Structs ohne Makros oder Boilerplate-Code in kompakte Byte-Arrays.

    560+0Sterne-Änderung der letzten 7 Tage
  • Einfacher Leistungsvergleich verschiedener Programmiersprachen (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)

    557+1Sterne-Änderung der letzten 7 Tage
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: eine große, robuste und umfassende Benchmarking-Plattform für automatische Spracherkennung.

    553+3Sterne-Änderung der letzten 7 Tage
  • Meta Agents Research Environments ist eine umfassende Plattform zur Evaluierung von KI-Agenten in dynamischen, realistischen Szenarien. Im Gegensatz zu statischen Benchmarks bietet diese Plattform sich entwickelnde Umgebungen, in denen Agenten ihre Strategien bei neuen Informationen anpassen müssen, um reale Herausforderungen abzubilden.

    550+3Sterne-Änderung der letzten 7 Tage
  • Datensatz und Benchmark für RAG auf internen Unternehmensdokumenten.

    545+8Sterne-Änderung der letzten 7 Tage
  • NBench@petabridge

    Performance-Benchmarking- und Test-Framework für .NET-Anwendungen

    540+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen