evaluation
標記 evaluation 主題、收錄中的開源專案,依星數排序。
- #61★ 768+0近 7 天星數變化
- #62
[EMNLP 2024 & AAAI 2026] 一個強大的大型模型壓縮工具包,包含 LLM、VLM 及影片生成模型。
★ 747+4近 7 天星數變化 - #63
🦞 OpenClaw 的官方插件,可將 agent 追蹤記錄匯出至 Opik。檢視並監控 agent 的行為、成本、token、錯誤等資訊。
★ 725+0近 7 天星數變化 - #64
IOU Tracker 的 Python 實作
★ 702+0近 7 天星數變化 - #65★ 697+4近 7 天星數變化
- #66
評測大型語言模型中的長文本事實準確性。我們論文「Long-form factuality in large language models」的原始程式碼。
★ 693+2近 7 天星數變化 - #67★ 664+61近 7 天星數變化
- #68
Awesome-LLM-Eval:精選的工具、資料集/基準測試、展示、排行榜、論文、文件與模型清單,主要用於 LLM 評估。一個由工具、基準/數據、演示、排行榜和大模型等組成的精選列表,主要面向基礎大模型評測,旨在探求生成式AI的技術邊界。
★ 656-2近 7 天星數變化 - #69
AutoPrompt:針對遮罩語言模型的自動提示詞建構。
★ 641+0近 7 天星數變化 - #70★ 632+2近 7 天星數變化
- #71
單一 C# 檔案中的簡單數學與偽 C# 表達式求值器。亦可執行類似 C# 的小型指令碼
★ 630+0近 7 天星數變化 - #72
大型語言模型機器遺忘(machine unlearning)資源庫
★ 623+0近 7 天星數變化 - #73★ 619+0近 7 天星數變化
- #74
適用於 Python 的簡單、安全、沙箱化、可擴充的表達式評估器
★ 611+0近 7 天星數變化 - #75
這是一個工具箱儲存庫,用於協助評估從一對圖像進行圖像匹配的各種方法。
★ 594+0近 7 天星數變化 - #76
此儲存庫包含論文「MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI」的評估程式碼
★ 593+1近 7 天星數變化 - #77
包含問題與 SQL 查詢配對的資料集集合
★ 588+1近 7 天星數變化 - #78
ParseBench - 用於 AI Agent 的文件解析基準測試。
★ 565+12近 7 天星數變化 - #79
Meta Agents Research Environments 是一個綜合平台,旨在評估動態、真實場景中的 AI 代理。與靜態基準測試不同,此平台引入了不斷演進的環境,代理必須隨著新資訊的出現調整策略,以反映現實世界的挑戰。
★ 551+3近 7 天星數變化 - #80
針對公司內部文件進行 RAG 的資料集與基準測試。
★ 546+11近 7 天星數變化