跳到主要内容
buildradar
Sign in
主题 · evals

evals

标记 evals 主题、收录中的开源项目,按星标数排序。

项目数
22
总星标数
86,828
平均星标数
3,947
占比
0.00%

常跟 evals 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 evals 主题的项目。

  • waku-agent@ShenSeanChen

    Waku Waku!Waku Agent 是一个由您真正拥有的本地优先 AI Agent 框架,包含循环、记忆与评估,所有代码均以易读性为核心构建,随项目成长仍保持清晰。

    1,649
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1,087
  • awesome-evals@benchflow-ai

    一个精选且无废话的最佳 AI 代理构建与评估资源库——论文、博客、演讲、工具、基准测试。由 BenchFlow 维护。

    865
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    617
  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    160
  • mastra@mastra-ai

    Mastra 是用于 AI 驱动应用与代理的现代 TypeScript 框架

    27,657+96近 7 天星标变化
  • phoenix@Arize-ai

    AI 可观测性与评估

    11,298+55近 7 天星标变化
  • agentops@AgentOps-AI

    Python SDK,用于 AI 代理监控、LLM 成本追踪、基准测试等,集成多数 LLM 和代理框架,包括 CrewAI、Agno、OpenAI Agents SDK、Langchain、Autogen、AG2、CamelAI

    5,808+3近 7 天星标变化
  • Kiln@Kiln-AI

    构建、评估与优化 AI 系统。包含评估、RAG、代理、微调、合成数据生成、数据集管理、MCP 等。

    5,042+5近 7 天星标变化
  • harbor@harbor-framework

    评估与改进代理的框架。

    4,884+120近 7 天星标变化
  • logfire@pydantic

    AI 可观测性平台,针对生产 LLM 与代理系统

    4,450+4近 7 天星标变化
  • trulens@truera

    LLM 实验与 AI 代理的评估与追踪

    3,530+2近 7 天星标变化
  • lmnr@lmnr-ai

    Laminar - 专为 AI agent 打造的开源可观测性平台。YC S24。

    3,219+9近 7 天星标变化
  • 专为构建生产环境 AI 系统与评估(evals)的工程师设计的 AI 系统设计指南。

    2,978+59近 7 天星标变化
  • agent-skills-platform@FrancyJGLisboa

    将任何工作流程转化为可在 17 个平台上安装的可复用 AI 智能体技能 — Claude Code、Copilot、Cursor、Windsurf、Codex、Gemini、Kiro 等。一个 SKILL.md,适用所有平台。

    2,371+20近 7 天星标变化
  • inspector@MCPJam

    用于对话、检查和调试 MCP servers、MCP apps 与 ChatGPT apps 的测试与评估平台。

    2,183+6近 7 天星标变化
  • failproofai@FailproofAI

    AI 代理框架的可观测性与执行强制。通过策略强制捕获每次运行与运行时可靠性。内置 40 种策略、本地仪表板,无需账户并提供慷慨的免费云端方案

    1,719+203近 7 天星标变化
  • evalite@mattpocock

    使用 TypeScript 评估您的 LLM 驱动应用程序

    1,673+3近 7 天星标变化
  • waku-agent@ShenSeanChen

    Waku Waku!Waku Agent 是一个由您真正拥有的本地优先 AI Agent 框架,包含循环、记忆与评估,所有代码均以易读性为核心构建,随项目成长仍保持清晰。

    1,649+41近 7 天星标变化
  • simba@GitHamza0206

    具备内置评估与监控功能的开源生产就绪客服系统

    1,539+1近 7 天星标变化
  • raglite@superlinear-ai

    🥤 RAGLite 是一个搭配 DuckDB 或 PostgreSQL 使用的 Python 检索增强生成(RAG)工具包。

    1,200+1近 7 天星标变化
  • Tracely-ai@Jwuthri

    针对 AI agents 的追踪原生 CI/CD — 生产环境失败转化为阻挡 PR 的回归测试。自动检测、分群、封装为隔离案例,在 CI 中以 0 美元重放。

    1,176-22近 7 天星标变化
  • heym@heymrun

    构建 Agentic 系统并自信地运行。编排 Agent、自动化业务流程、检查每次执行,并保持人类掌控。将 Heym 部署在您自己的基础设施上。

    1,125+75近 7 天星标变化
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1,087+190近 7 天星标变化
  • SkillForge@tripleyak

    一个能证明自身技能运作正常的技能构建器。为 Claude Code 与 Codex 提供证据驱动的技能构建:基准测试生成、各技能回归评估、生态系统检查、跨运行时编译,以及选用的主动式建议工具。

    888+3近 7 天星标变化
  • awesome-evals@benchflow-ai

    一个精选且无废话的最佳 AI 代理构建与评估资源库——论文、博客、演讲、工具、基准测试。由 BenchFlow 维护。

    865+18近 7 天星标变化
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    617近 7 天星标变化
← 返回主题列表