跳到主要内容
buildradar
Sign in
主题 · agent-evaluation

agent-evaluation

标记 agent-evaluation 主题、收录中的开源项目,按星标数排序。

项目数
9
总星标数
32,319
平均星标数
3,591
占比
0.00%

常跟 agent-evaluation 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 agent-evaluation 主题的项目。

  • awesome-evals@benchflow-ai

    一个精选且无废话的最佳 AI 代理构建与评估资源库——论文、博客、演讲、工具、基准测试。由 BenchFlow 维护。

    865
  • iFixAi@ifixai-ai

    AI 代理的独立审计。由人类或代理自行执行,以回答 AI 代理经济中最关键的问题:代理是否在执行其应有的任务?使用 iFixAi,您可在 120 秒内得到答案。

    12,643+1,247近 7 天星标变化
  • giskard-oss@Giskard-AI

    🐢 开源的 LLM 代理评估与测试库

    5,801+9近 7 天星标变化
  • coze-loop@coze-dev

    下一代 AI 代理优化平台:Cozeloop 提供从开发、调试、评估到监控的全生命周期管理,解决 AI 代理开发挑战。

    5,711+5近 7 天星标变化
  • trulens@truera

    LLM 实验与 AI 代理的评估与追踪

    3,530+2近 7 天星标变化
  • any-agent@mozilla-ai

    用于使用与评估不同 agent 框架的单一接口

    1,199+2近 7 天星标变化
  • intelligent-audit-system@Ricky-7-Yan

    AuditPilot:具备可稽核性的企业级 AI 代理,支持以证据为基础的工作流程、受管工具、评估工具、人工审查与修复交付。

    1,166+0近 7 天星标变化
  • awesome-evals@benchflow-ai

    一个精选且无废话的最佳 AI 代理构建与评估资源库——论文、博客、演讲、工具、基准测试。由 BenchFlow 维护。

    865+17近 7 天星标变化
  • pandaprobe@chirpz-ai

    开源 agent 工程平台:用于调试和改进 AI agent 的追踪、评估与指标。整合了 LangGraph、CrewAI、Claude Agent SDK 等。

    783+1近 7 天星标变化
  • ClawBench@TIGER-AI-Lab

    用于浏览器 AI 代理日常任务的开源基准测试

    664+54近 7 天星标变化
← 返回主题列表