Lompat ke konten utama
buildradar
Sign in
Topik · evaluation

evaluation

Repositori open source terpantau bertanda evaluation, diurutkan berdasarkan bintang.

80 repositori
  • RAG-FiT@IntelLabs

    Kerangka kerja untuk meningkatkan LLM untuk tugas RAG menggunakan fine-tuning.

    768+0Perubahan bintang dalam 7 hari terakhir
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Toolkit canggih untuk mengompresi model besar termasuk LLM, VLM, dan model generatif video.

    747+4Perubahan bintang dalam 7 hari terakhir
  • opik-openclaw@comet-ml

    🦞 Plugin resmi untuk OpenClaw yang mengekspor jejak agen ke Opik. Lihat dan pantau perilaku agen, biaya, token, kesalahan, dan lainnya.

    725+0Perubahan bintang dalam 7 hari terakhir
  • iou-tracker@bochinski

    Implementasi Python dari IOU Tracker

    702+0Perubahan bintang dalam 7 hari terakhir
  • ranx@AmenRa

    ⚡️Pustaka Python yang sangat cepat untuk evaluasi, perbandingan, dan fusi peringkat 🐍

    697+4Perubahan bintang dalam 7 hari terakhir
  • long-form-factuality@google-deepmind

    Tolok ukur faktualitas bentuk panjang dalam model bahasa besar. Kode asli untuk makalah kami "Long-form factuality in large language models".

    693+2Perubahan bintang dalam 7 hari terakhir
  • ClawBench@TIGER-AI-Lab

    Benchmark open-source untuk AI agent browser pada tugas sehari-hari.

    664+54Perubahan bintang dalam 7 hari terakhir
  • Awesome-LLM-Eval: Daftar kurasi alat, dataset/benchmark, demo, papan peringkat, makalah, dokumen, dan model, terutama untuk evaluasi LLM.

    656-2Perubahan bintang dalam 7 hari terakhir
  • autoprompt@ucinlp

    AutoPrompt: Pembuatan Prompt Otomatis untuk Masked Language Models.

    641+0Perubahan bintang dalam 7 hari terakhir
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Kepercayaan dalam Model Bahasa Besar (LLM)

    632+2Perubahan bintang dalam 7 hari terakhir
  • Evaluator Ekspresi Matematika dan Pseudo C# Sederhana dalam Satu File C#. Juga dapat mengeksekusi skrip kecil mirip C#

    630+0Perubahan bintang dalam 7 hari terakhir
  • Repositori sumber daya untuk machine unlearning pada model bahasa besar (large language models)

    623+0Perubahan bintang dalam 7 hari terakhir
  • tcexam@tecnickcom

    TCExam adalah sistem CBA (Penilaian Berbasis Komputer) (ujian elektronik, CBT - Pengujian Berbasis Komputer) untuk universitas, sekolah, dan perusahaan, yang memungkinkan pendidik dan pelatih untuk membuat, menjadwalkan, menyampaikan, dan melaporkan survei, kuis, tes, dan ujian.

    619+0Perubahan bintang dalam 7 hari terakhir
  • simpleeval@danthedeckie

    Evaluator Ekspresi yang Sederhana, Aman, Tersekat (Sandboxed), dan Dapat Diperluas untuk Python

    611+0Perubahan bintang dalam 7 hari terakhir
  • image-matching-toolbox@GrumpyZhou

    Ini adalah repositori kotak alat untuk membantu mengevaluasi berbagai metode yang melakukan pencocokan gambar dari sepasang gambar.

    594+0Perubahan bintang dalam 7 hari terakhir
  • MMMU@MMMU-Benchmark

    Repositori ini berisi kode evaluasi untuk makalah "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

    593+1Perubahan bintang dalam 7 hari terakhir
  • text2sql-data@jkkummerfeld

    Kumpulan dataset yang memetakan pertanyaan ke kueri SQL.

    588+1Perubahan bintang dalam 7 hari terakhir
  • ParseBench@run-llama

    ParseBench - Tolok Ukur Penguraian Dokumen untuk AI Agent

    565+10Perubahan bintang dalam 7 hari terakhir
  • Meta Agents Research Environments adalah platform komprehensif yang dirancang untuk mengevaluasi agen AI dalam skenario yang dinamis dan realistis. Tidak seperti tolok ukur statis, platform ini memperkenalkan lingkungan yang terus berkembang di mana agen harus menyesuaikan strategi mereka saat informasi baru tersedia, mencerminkan tantangan di dunia nyata.

    550+3Perubahan bintang dalam 7 hari terakhir
  • Dataset dan tolok ukur untuk RAG pada dokumen internal perusahaan.

    545+8Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik