跳到主要內容
buildradar
Sign in
主題 · evaluation

evaluation

標記 evaluation 主題、收錄中的開源專案,依星數排序。

共 80 個專案
  • RAG-FiT@IntelLabs

    使用微調增強 LLM 以執行 RAG 任務的框架。

    768+0近 7 天星數變化
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] 一個強大的大型模型壓縮工具包,包含 LLM、VLM 及影片生成模型。

    747+4近 7 天星數變化
  • opik-openclaw@comet-ml

    🦞 OpenClaw 的官方插件,可將 agent 追蹤記錄匯出至 Opik。檢視並監控 agent 的行為、成本、token、錯誤等資訊。

    725+0近 7 天星數變化
  • iou-tracker@bochinski

    IOU Tracker 的 Python 實作

    702+0近 7 天星數變化
  • ranx@AmenRa

    ⚡️ 用於排序評估、比較與融合的極速 Python 函式庫 🐍

    697+4近 7 天星數變化
  • long-form-factuality@google-deepmind

    評測大型語言模型中的長文本事實準確性。我們論文「Long-form factuality in large language models」的原始程式碼。

    693+2近 7 天星數變化
  • ClawBench@TIGER-AI-Lab

    用於瀏覽器 AI 代理日常任務的開源基準測試

    664+61近 7 天星數變化
  • Awesome-LLM-Eval:精選的工具、資料集/基準測試、展示、排行榜、論文、文件與模型清單,主要用於 LLM 評估。一個由工具、基準/數據、演示、排行榜和大模型等組成的精選列表,主要面向基礎大模型評測,旨在探求生成式AI的技術邊界。

    656-2近 7 天星數變化
  • autoprompt@ucinlp

    AutoPrompt:針對遮罩語言模型的自動提示詞建構。

    641+0近 7 天星數變化
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM:大型語言模型的信任度

    632+2近 7 天星數變化
  • 單一 C# 檔案中的簡單數學與偽 C# 表達式求值器。亦可執行類似 C# 的小型指令碼

    630+0近 7 天星數變化
  • 大型語言模型機器遺忘(machine unlearning)資源庫

    623+0近 7 天星數變化
  • tcexam@tecnickcom

    TCExam 是一個適用於大學、學校和企業的電腦化評量系統(電子考試、CBT),讓教育工作者與培訓師能夠建立、排程、執行並報告調查、測驗、測試與考試。

    619+0近 7 天星數變化
  • simpleeval@danthedeckie

    適用於 Python 的簡單、安全、沙箱化、可擴充的表達式評估器

    611+0近 7 天星數變化
  • image-matching-toolbox@GrumpyZhou

    這是一個工具箱儲存庫,用於協助評估從一對圖像進行圖像匹配的各種方法。

    594+0近 7 天星數變化
  • MMMU@MMMU-Benchmark

    此儲存庫包含論文「MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI」的評估程式碼

    593+1近 7 天星數變化
  • text2sql-data@jkkummerfeld

    包含問題與 SQL 查詢配對的資料集集合

    588+1近 7 天星數變化
  • ParseBench@run-llama

    ParseBench - 用於 AI Agent 的文件解析基準測試。

    565+12近 7 天星數變化
  • Meta Agents Research Environments 是一個綜合平台,旨在評估動態、真實場景中的 AI 代理。與靜態基準測試不同,此平台引入了不斷演進的環境,代理必須隨著新資訊的出現調整策略,以反映現實世界的挑戰。

    551+3近 7 天星數變化
  • 針對公司內部文件進行 RAG 的資料集與基準測試。

    546+11近 7 天星數變化
← 返回主題列表