跳到主要内容
buildradar
Sign in
主题 · evaluation-framework

evaluation-framework

标记 evaluation-framework 主题、收录中的开源项目,按星标数排序。

项目数
10
总星标数
70,935
平均星标数
7,094
占比
0.00%

常跟 evaluation-framework 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 evaluation-framework 主题的项目。

  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    151
  • promptfoo@promptfoo

    测试你的提示、代理与检索增强生成,进行 AI 红队/渗透测试/漏洞扫描。比较 GPT、Claude、Gemini、DeepSeek 等表现。使用简洁声明式配置,支持命令行与 CI/CD 集成。OpenAI 与 Anthropic 均有使用。

    24,767+103近 7 天星标变化
  • deepeval@confident-ai

    LLM 评估框架

    18,063+110近 7 天星标变化
  • lm-evaluation-harness@EleutherAI

    用于少样本评估语言模型的框架

    13,873+46近 7 天星标变化
  • Kiln@Kiln-AI

    构建、评估与优化 AI 系统。包含评估、RAG、代理、微调、合成数据生成、数据集管理、MCP 等。

    5,042+5近 7 天星标变化
  • lighteval@huggingface

    Lighteval 是您跨多种后端评估 LLM 的全方位工具包

    2,533+3近 7 天星标变化
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: 评估 AI 的最新技术水平

    2,037-2近 7 天星标变化
  • future-agi@future-agi

    开源的端到端平台,用于评估、观察与改进 LLM 及 AI agent 应用程序。包含追踪、评估、模拟、数据集、网关、安全护栏。支持自行架设。采用 Apache 2.0 授权。

    1,909+42近 7 天星标变化
  • ai-agents-the-definitive-guide@Nicolepcx

    AI Agents 终极指南仓库

    1,567+220近 7 天星标变化
  • AgentLab@ServiceNow

    AgentLab:一个用于在各种任务上开发、测试与评测 web agent 的开源框架,专为可扩展性与可复现性而设计。

    629+1近 7 天星标变化
  • continuous-eval@relari-ai

    基于 LLM 应用程序的数据驱动评估

    517+1近 7 天星标变化
← 返回主题列表