Zum Hauptinhalt springen
buildradar
Sign in
Thema · evaluation

evaluation

Erfasste Open-Source-Repos mit dem Tag evaluation, sortiert nach Sternen.

80 Repos
  • RAG-FiT@IntelLabs

    Framework zur Verbesserung von LLMs für RAG-Aufgaben mittels Fine-Tuning.

    768+0Sterne-Änderung der letzten 7 Tage
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Ein leistungsstarkes Toolkit zur Komprimierung großer Modelle einschließlich LLMs, VLMs und Video-Generierungsmodellen.

    747+4Sterne-Änderung der letzten 7 Tage
  • opik-openclaw@comet-ml

    🦞 Offizielles Plugin für OpenClaw, das Agenten-Traces nach Opik exportiert. Überwachen Sie Agentenverhalten, Kosten, Token, Fehler und mehr.

    725+0Sterne-Änderung der letzten 7 Tage
  • iou-tracker@bochinski

    Python-Implementierung des IOU Trackers

    702+0Sterne-Änderung der letzten 7 Tage
  • ranx@AmenRa

    ⚡️Eine blitzschnelle Python-Bibliothek für Ranking-Evaluierung, -Vergleich und -Fusion 🐍

    697+4Sterne-Änderung der letzten 7 Tage
  • long-form-factuality@google-deepmind

    Benchmarking der Langform-Faktizität in Large Language Models. Originalcode für unser Paper „Long-form factuality in large language models“.

    693+2Sterne-Änderung der letzten 7 Tage
  • ClawBench@TIGER-AI-Lab

    Open-Source-Benchmark für Browser-KI-Agenten bei alltäglichen Aufgaben.

    664+54Sterne-Änderung der letzten 7 Tage
  • Awesome-LLM-Eval: eine kuratierte Liste von Tools, Datensätzen/Benchmarks, Demos, Bestenlisten, Papers, Dokumenten und Modellen, hauptsächlich zur Evaluierung von LLMs.

    656-2Sterne-Änderung der letzten 7 Tage
  • autoprompt@ucinlp

    AutoPrompt: Automatische Prompt-Erstellung für maskierte Sprachmodelle.

    641+0Sterne-Änderung der letzten 7 Tage
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Vertrauenswürdigkeit in Large Language Models

    632+2Sterne-Änderung der letzten 7 Tage
  • Ein einfacher Mathe- und Pseudo-C#-Expression-Evaluator in einer C#-Datei. Kann auch kleine C#-ähnliche Skripte ausführen

    630+0Sterne-Änderung der letzten 7 Tage
  • Ein Ressourcen-Repository für Machine Unlearning in Large Language Models

    623+0Sterne-Änderung der letzten 7 Tage
  • tcexam@tecnickcom

    TCExam ist ein computerbasiertes Bewertungssystem (CBA) für Universitäten, Schulen und Unternehmen, mit dem Lehrende und Ausbilder Umfragen, Quizze, Tests und Prüfungen erstellen, planen, durchführen und auswerten können.

    619+0Sterne-Änderung der letzten 7 Tage
  • simpleeval@danthedeckie

    Einfacher, sicherer, in einer Sandbox ausgeführter und erweiterbarer Ausdrucksauswerter für Python

    611+0Sterne-Änderung der letzten 7 Tage
  • image-matching-toolbox@GrumpyZhou

    Eine Toolbox zur Evaluierung verschiedener Methoden für das Image Matching basierend auf Bildpaaren.

    594+0Sterne-Änderung der letzten 7 Tage
  • MMMU@MMMU-Benchmark

    Dieses Repository enthält Evaluierungscode für das Paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

    593+1Sterne-Änderung der letzten 7 Tage
  • text2sql-data@jkkummerfeld

    Eine Sammlung von Datensätzen, die Fragen mit SQL-Abfragen verknüpfen.

    588+1Sterne-Änderung der letzten 7 Tage
  • ParseBench@run-llama

    ParseBench - Ein Dokumenten-Parsing-Benchmark für KI-Agenten

    565+10Sterne-Änderung der letzten 7 Tage
  • Meta Agents Research Environments ist eine umfassende Plattform zur Evaluierung von KI-Agenten in dynamischen, realistischen Szenarien. Im Gegensatz zu statischen Benchmarks bietet diese Plattform sich entwickelnde Umgebungen, in denen Agenten ihre Strategien bei neuen Informationen anpassen müssen, um reale Herausforderungen abzubilden.

    550+3Sterne-Änderung der letzten 7 Tage
  • Datensatz und Benchmark für RAG auf internen Unternehmensdokumenten.

    545+8Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen