evaluation
標記 evaluation 主題、收錄中的開源專案,依星數排序。
- #31
分享我們在管理 Open LLM Leaderboard 與設計 lighteval 期間所累積關於 LLM 評估的實務見解與理論知識!
★ 2,143+2近 7 天星數變化 - #32★ 2,088+0近 7 天星數變化
- #33★ 2,037-2近 7 天星數變化
- #34
指令遵循語言模型的自動評估器。經人工驗證、高品質、低成本且快速。
★ 2,012-1近 7 天星數變化 - #35★ 1,846+0近 7 天星數變化
- #36
WFGY 正在邁向 WFGY 5.0 Polaris Protocol,這是一個針對 AI 推理、RAG、Agent 與真實世界工作流程的重大開源版本。包含 Problem Map、Global Debug Card、WFGY 4.0 以及 CFV 復活節彩蛋。
★ 1,786+1近 7 天星數變化 - #37
心理健康大模型 (LLM x Mental Health), Pre & Post-training & Dataset & Evaluation & Depoly & RAG, 搭配 InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM 系列模型
★ 1,781+1近 7 天星數變化 - #38
一個用於建構生產級 Agent 系統的 Go 框架,支援圖形工作流程、工具、記憶體、A2A、AG-UI、MCP、評估與可觀測性。
★ 1,760+12近 7 天星數變化 - #39★ 1,668+0近 7 天星數變化
- #40
綜述論文 "A Survey on Evaluation of Large Language Models" 的官方 GitHub 頁面。
★ 1,608-1近 7 天星數變化 - #41★ 1,506+0近 7 天星數變化
- #42★ 1,391+0近 7 天星數變化
- #43★ 1,300+0近 7 天星數變化
- #44★ 1,260+0近 7 天星數變化
- #45
使用模擬、逼真合成互動來全面診斷與最佳化 agent 的框架
★ 1,257+0近 7 天星數變化 - #46
KernelBench:LLMs 能寫出 GPU Kernels 嗎? - 基準測試 + 包含 Torch -> CUDA(以及更多 DSL)的工具包
★ 1,227+7近 7 天星數變化 - #47★ 1,224+0近 7 天星數變化
- #48★ 1,206+0近 7 天星數變化
- #49
PyTorch 中生成式模型的高傳真效能指標
★ 1,200+1近 7 天星數變化 - #50
針對 AI agents 的追蹤原生 CI/CD — 生產環境失敗轉化為阻擋 PR 的迴歸測試。自動偵測、分群、封裝為隔離案例,在 CI 中以 0 美元重播。
★ 1,176-22近 7 天星數變化 - #51★ 1,156+2近 7 天星數變化
- #52★ 1,155+7近 7 天星數變化
- #53
使用 Prometheus 與 GPT4 評估你的 LLM 回應 💯
★ 1,111+4近 7 天星數變化 - #54
LangSmith 客戶端 SDK 實作
★ 1,049+9近 7 天星數變化 - #55
用於視覺化資料集、處理資料及評估結果的 SemanticKITTI API。
★ 898+3近 7 天星數變化 - #56
在單一管線中生成高品質合成資料、訓練、測量與評估
★ 885+3近 7 天星數變化 - #57
ClawProBench 是一個即時優先的基準測試工具,用於評估 OpenClaw 執行環境中的 LLM 代理,具備確定性評分與重複試驗的可靠性。
★ 823+0近 7 天星數變化 - #58★ 819+14近 7 天星數變化
- #59★ 814+1近 7 天星數變化
- #60
Web Codegen Scorer 是一個用來評估 LLM 所產生網頁程式碼品質的工具。
★ 775+4近 7 天星數變化