跳到主要內容
buildradar
Sign in
主題 · evaluation

evaluation

標記 evaluation 主題、收錄中的開源專案,依星數排序。

共 80 個專案
  • evaluation-guidebook@huggingface

    分享我們在管理 Open LLM Leaderboard 與設計 lighteval 期間所累積關於 LLM 評估的實務見解與理論知識!

    2,143+2近 7 天星數變化
  • avalanche@ContinualAI

    Avalanche:一個基於 PyTorch 的端對端持續學習函式庫。

    2,088+0近 7 天星數變化
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: 評估 AI 的最新技術水準

    2,037-2近 7 天星數變化
  • alpaca_eval@tatsu-lab

    指令遵循語言模型的自動評估器。經人工驗證、高品質、低成本且快速。

    2,012-1近 7 天星數變化
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020)「3D 多物件追蹤:基準與新評估指標」官方 Python 實作

    1,846+0近 7 天星數變化
  • WFGY@onestardao

    WFGY 正在邁向 WFGY 5.0 Polaris Protocol,這是一個針對 AI 推理、RAG、Agent 與真實世界工作流程的重大開源版本。包含 Problem Map、Global Debug Card、WFGY 4.0 以及 CFV 復活節彩蛋。

    1,786+1近 7 天星數變化
  • EmoLLM@SmartFlowAI

    心理健康大模型 (LLM x Mental Health), Pre & Post-training & Dataset & Evaluation & Depoly & RAG, 搭配 InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM 系列模型

    1,781+1近 7 天星數變化
  • trpc-agent-go@trpc-group

    一個用於建構生產級 Agent 系統的 Go 框架,支援圖形工作流程、工具、記憶體、A2A、AG-UI、MCP、評估與可觀測性。

    1,760+12近 7 天星數變化
  • ragbits@deepsense-ai

    用於快速開發 GenAI 應用程式的建構區塊。

    1,668+0近 7 天星數變化
  • 綜述論文 "A Survey on Evaluation of Large Language Models" 的官方 GitHub 頁面。

    1,608-1近 7 天星數變化
  • pycm@sepandhaghighi

    Python 的多類別混淆矩陣程式庫

    1,506+0近 7 天星數變化
  • nlg-eval@Maluuba

    自然語言生成多種無監督自動化指標的評估程式碼

    1,391+0近 7 天星數變化
  • lispy@abo-abo

    簡潔流暢的 LISP 編輯體驗。

    1,300+0近 7 天星數變化
  • xai@EthicalML

    XAI - 機器學習的可解釋性工具箱

    1,260+0近 7 天星數變化
  • intellagent@plurai-ai

    使用模擬、逼真合成互動來全面診斷與最佳化 agent 的框架

    1,257+0近 7 天星數變化
  • KernelBench@ScalingIntelligence

    KernelBench:LLMs 能寫出 GPU Kernels 嗎? - 基準測試 + 包含 Torch -> CUDA(以及更多 DSL)的工具包

    1,227+7近 7 天星數變化
  • kubetorch@run-house

    在 Kubernetes 上以 Python 神奇地分發並執行 AI 工作負載,就像用於 ML 基礎設施的 PyTorch 一樣。

    1,224+0近 7 天星數變化
  • fuzzbench@google

    FuzzBench - 模糊測試器基準測試服務。

    1,206+0近 7 天星數變化
  • torch-fidelity@toshas

    PyTorch 中生成式模型的高傳真效能指標

    1,200+1近 7 天星數變化
  • Tracely-ai@Jwuthri

    針對 AI agents 的追蹤原生 CI/CD — 生產環境失敗轉化為阻擋 PR 的迴歸測試。自動偵測、分群、封裝為隔離案例,在 CI 中以 0 美元重播。

    1,176-22近 7 天星數變化
  • ncalc@ncalc

    NCalc 是一個適用於 .NET 的快速且輕量級表達式評估函式庫,專為靈活性與高效能而設計。它支援廣泛的數學與邏輯運算。

    1,156+2近 7 天星數變化
  • Gym@NVIDIA-NeMo

    使用環境評估並改善模型與 agent

    1,155+7近 7 天星數變化
  • prometheus-eval@prometheus-eval

    使用 Prometheus 與 GPT4 評估你的 LLM 回應 💯

    1,111+4近 7 天星數變化
  • langsmith-sdk@langchain-ai

    LangSmith 客戶端 SDK 實作

    1,049+9近 7 天星數變化
  • 用於視覺化資料集、處理資料及評估結果的 SemanticKITTI API。

    898+3近 7 天星數變化
  • deepfabric@nolabs-ai

    在單一管線中生成高品質合成資料、訓練、測量與評估

    885+3近 7 天星數變化
  • ClawProBench@suyoumo

    ClawProBench 是一個即時優先的基準測試工具,用於評估 OpenClaw 執行環境中的 LLM 代理,具備確定性評分與重複試驗的可靠性。

    823+0近 7 天星數變化
  • OpenJudge@agentscope-ai

    OpenJudge:用於全面評估與品質獎勵的統一框架

    819+14近 7 天星數變化
  • gval@PaesslerAG

    在 Golang 中進行表達式評估

    814+1近 7 天星數變化
  • web-codegen-scorer@angular

    Web Codegen Scorer 是一個用來評估 LLM 所產生網頁程式碼品質的工具。

    775+4近 7 天星數變化
← 返回主題列表