跳到主要内容
buildradar
Sign in
主题 · evaluation

evaluation

标记 evaluation 主题、收录中的开源项目,按星标数排序。

共 80 个项目
  • evaluation-guidebook@huggingface

    分享我们在管理 Open LLM Leaderboard 与设计 lighteval 期间所积累关于 LLM 评估的实务见解与理论知识!

    2,143+2近 7 天星标变化
  • avalanche@ContinualAI

    Avalanche:一个基于 PyTorch 的端到端持续学习库。

    2,088+0近 7 天星标变化
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: 评估 AI 的最新技术水平

    2,037-2近 7 天星标变化
  • alpaca_eval@tatsu-lab

    指令遵循语言模型的自动评估器。经人工验证、高质量、低成本且快速。

    2,012-1近 7 天星标变化
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020)“3D 多目标跟踪:基准与新评估指标”官方 Python 实现

    1,846+0近 7 天星标变化
  • WFGY@onestardao

    WFGY 正在迈向 WFGY 5.0 Polaris Protocol,这是一个针对 AI 推理、RAG、Agent 与真实世界工作流程的重大开源版本。包含 Problem Map、Global Debug Card、WFGY 4.0 以及 CFV 彩蛋。

    1,786+1近 7 天星标变化
  • EmoLLM@SmartFlowAI

    心理健康大模型 (LLM x Mental Health), Pre & Post-training & Dataset & Evaluation & Depoly & RAG, 搭配 InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM 系列模型

    1,781+1近 7 天星标变化
  • trpc-agent-go@trpc-group

    一个用于构建生产级 Agent 系统的 Go 框架,支持图形工作流程、工具、内存、A2A、AG-UI、MCP、评估与可观测性。

    1,760+12近 7 天星标变化
  • ragbits@deepsense-ai

    用于快速开发 GenAI 应用程序的构建块。

    1,668+0近 7 天星标变化
  • 综述论文 "A Survey on Evaluation of Large Language Models" 的官方 GitHub 页面。

    1,608-1近 7 天星标变化
  • pycm@sepandhaghighi

    Python 的多类别混淆矩阵库

    1,506+0近 7 天星标变化
  • nlg-eval@Maluuba

    自然语言生成多种无监督自动化指标的评估代码

    1,391+0近 7 天星标变化
  • lispy@abo-abo

    简短精炼的 LISP 编辑体验。

    1,300+0近 7 天星标变化
  • xai@EthicalML

    XAI - 机器学习的可解释性工具箱

    1,260+0近 7 天星标变化
  • intellagent@plurai-ai

    使用模拟、逼真合成互动来全面诊断与优化 agent 的框架

    1,257+0近 7 天星标变化
  • KernelBench@ScalingIntelligence

    KernelBench:LLMs 能写出 GPU Kernels 吗? - 基准测试 + 包含 Torch -> CUDA(以及更多 DSL)的工具包

    1,227+7近 7 天星标变化
  • kubetorch@run-house

    在 Kubernetes 上以 Python 神奇地分发并执行 AI 工作负载,就像用于 ML 基础设施的 PyTorch 一样。

    1,224+0近 7 天星标变化
  • fuzzbench@google

    FuzzBench - 模糊测试器基准测试服务。

    1,206+0近 7 天星标变化
  • torch-fidelity@toshas

    PyTorch 中生成式模型的高保真性能指标

    1,200+1近 7 天星标变化
  • Tracely-ai@Jwuthri

    针对 AI agents 的追踪原生 CI/CD — 生产环境失败转化为阻挡 PR 的回归测试。自动检测、分群、封装为隔离案例,在 CI 中以 0 美元重放。

    1,176-22近 7 天星标变化
  • ncalc@ncalc

    NCalc 是一个适用于 .NET 的快速且轻量级表达式评估库,专为灵活性与高性能而设计。它支持广泛的数学与逻辑运算。

    1,156+2近 7 天星标变化
  • Gym@NVIDIA-NeMo

    使用环境评估并改善模型与 agent

    1,155+7近 7 天星标变化
  • prometheus-eval@prometheus-eval

    使用 Prometheus 与 GPT4 评估你的 LLM 响应 💯

    1,111+4近 7 天星标变化
  • langsmith-sdk@langchain-ai

    LangSmith 客户端 SDK 实现

    1,050+9近 7 天星标变化
  • 用于可视化数据集、处理数据及评估结果的 SemanticKITTI API。

    898+3近 7 天星标变化
  • deepfabric@nolabs-ai

    在单一管线中生成高质量合成数据、训练、测量与评估

    885+3近 7 天星标变化
  • ClawProBench@suyoumo

    ClawProBench 是一个实时优先的基准测试工具,用于评估 OpenClaw 运行环境中的 LLM 代理,具备确定性评分与重复试验的可靠性。

    823+0近 7 天星标变化
  • OpenJudge@agentscope-ai

    OpenJudge:用于全面评估与质量奖励的统一框架

    820+14近 7 天星标变化
  • gval@PaesslerAG

    在 Golang 中进行表达式求值

    814+1近 7 天星标变化
  • web-codegen-scorer@angular

    Web Codegen Scorer 是一个用来评估 LLM 所生成网页代码质量的工具。

    774+4近 7 天星标变化
← 返回主题列表