跳到主要内容
buildradar
Sign in
主题 · llm-evaluation

llm-evaluation

标记 llm-evaluation 主题、收录中的开源项目,按星标数排序。

项目数
37
总星标数
234,912
平均星标数
6,349
占比
0.01%

常跟 llm-evaluation 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 llm-evaluation 主题的项目。

  • awesome-evals@benchflow-ai

    一个精选且无废话的最佳 AI 代理构建与评估资源库——论文、博客、演讲、工具、基准测试。由 BenchFlow 维护。

    865
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    646
  • KADATH@i3T4AN

    Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

    352
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 开源 AI 工程平台:LLM 评估、可观测性、指标、提示管理、游乐场、数据集。整合 OpenTelemetry、LangChain、OpenAI SDK、LiteLLM 等。🍊YC W23

    34,116+207近 7 天星标变化
  • mlflow@mlflow

    开源 AI 工程平台,支持代理、LLM 与机器学习模型。MLflow 使各种规模的团队能够调试、评估、监控和优化生产级 AI 应用,同时控制成本并管理模型和数据的访问。

    27,783+55近 7 天星标变化
  • promptfoo@promptfoo

    测试你的提示、代理与检索增强生成,进行 AI 红队/渗透测试/漏洞扫描。比较 GPT、Claude、Gemini、DeepSeek 等表现。使用简洁声明式配置,支持命令行与 CI/CD 集成。OpenAI 与 Anthropic 均有使用。

    24,767+103近 7 天星标变化
  • opik@comet-ml

    调试、评估和监控您的 LLM 应用、RAG 系统与代理工作流,提供完整追踪、自动评估和可投入生产的仪表板。

    21,752+84近 7 天星标变化
  • deepeval@confident-ai

    LLM 评估框架

    18,063+110近 7 天星标变化
  • iFixAi@ifixai-ai

    AI 代理的独立审计。由人类或代理自行执行,以回答 AI 代理经济中最关键的问题:代理是否在执行其应有的任务?使用 iFixAi,您可在 120 秒内得到答案。

    12,643+1,247近 7 天星标变化
  • phoenix@Arize-ai

    AI 可观测性与评估

    11,298+55近 7 天星标变化
  • garak@NVIDIA

    LLM 漏洞扫描器

    9,094+23近 7 天星标变化
  • 非线智能 NoneLinear - ReLE评测:中文 AI 大模型能力评测(持续更新):目前已囊括374个大模型,覆盖 chatgpt、gpt-5.4、谷歌 gemini-3.1-pro、Claude-4.6、文心 ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤 senseChat 等商用模型,以及 step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱 GLM-5.1、MiMo-V2、LongCat、gemma4、mistral 等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。

    6,415+6近 7 天星标变化
  • helicone@Helicone

    🧊 开源 LLM 可观测平台,一行代码即可监控、评估与实验

    6,127+11近 7 天星标变化
  • AI-Infra-Guard@Tencent

    全栈 AI Red Teaming 平台,通过 Agent Scan、Skills Scan、MCP Scan、AI Infra Scan 以及 LLM jailbreak 评估来保护 AI 生态系统。

    6,117+59近 7 天星标变化
  • giskard-oss@Giskard-AI

    🐢 开源的 LLM 代理评估与测试库

    5,801+9近 7 天星标变化
  • ouroboros@Q00

    Agent OS:代理自行变得更聪明。我们只负责接口:等级指令与预期结果不会写入成功合约。面试筛选、阶段评估、预算演化循环。MCP 服务器,支持 13 种运行时:Claude Code、Codex CLI、Gemini CLI、OpenCode、Copilot、Kiro 等。

    5,753+25近 7 天星标变化
  • LLM-Engineers-Handbook@PacktPublishing

    LLM 实务指南:从基础到在 AWS 上部署先进 LLM 与 RAG 应用,采用 LLMOps 最佳实践

    5,310+8近 7 天星标变化
  • AutoRAG@Marker-Inc-Korea

    AutoRAG:现在你的代理能在电脑中寻找任何东西,使用频率越高越聪明

    5,058+1近 7 天星标变化
  • lmms-eval@EvolvingLMMs-Lab

    涵盖文本、图像、视频和音频任务的全能多模态评估工具包

    4,390+7近 7 天星标变化
  • AI-Engineer-Headquarters@hemansnation

    一套科学方法、流程、算法与系统,用于构建故事与模型

    3,676+2近 7 天星标变化
  • trulens@truera

    LLM 实验与 AI 代理的评估与追踪

    3,530+2近 7 天星标变化
  • lmnr@lmnr-ai

    Laminar - 专为 AI agent 打造的开源可观测性平台。YC S24。

    3,219+9近 7 天星标变化
  • generative-ai@genieincodebottle

    生成式 AI 的完整资源,包含详细的路线图、项目、使用案例、面试准备和代码练习。

    2,610+1近 7 天星标变化
  • agentic_security@msoedov

    Agentic LLM 漏洞扫描器 / AI 红队测试套件 🧪

    1,983+3近 7 天星标变化
  • future-agi@future-agi

    开源的端到端平台,用于评估、观察与改进 LLM 及 AI agent 应用程序。包含追踪、评估、模拟、数据集、网关、安全护栏。支持自行架设。采用 Apache 2.0 授权。

    1,909+42近 7 天星标变化
  • aisheets@huggingface

    使用 AI 模型构建、丰富与转换数据集,全程无需代码

    1,641-1近 7 天星标变化
  • FuzzyAI@cyberark

    用于自动化 LLM 模糊测试的强大工具。旨在协助开发人员与安全性研究人员识别并减轻其 LLM API 中的潜在越狱问题。

    1,573+4近 7 天星标变化
  • prompty@microsoft

    Prompty 让您能轻松为 AI 应用程序创建、管理、调试及评估 LLM prompt。Prompty 是专为 LLM prompt 设计的资产类别与格式,旨在提升开发者的可观测性、可理解性与可移植性。

    1,255+1近 7 天星标变化
  • uqlm@cvs-health

    [JMLR 2026] "UQLM:用于大型语言模型不确定性量化的 Python 套件"

    1,194+1近 7 天星标变化
  • Tracely-ai@Jwuthri

    针对 AI agents 的追踪原生 CI/CD — 生产环境失败转化为阻挡 PR 的回归测试。自动检测、分群、封装为隔离案例,在 CI 中以 0 美元重放。

    1,176-22近 7 天星标变化
  • judgeval@JudgmentLabs

    面向 Agent 的持续改进栈。我们的环境数据与评估为 Agent 的改进和监控提供动力。

    1,060+2近 7 天星标变化
  • FinSight-AI@juanjuandog

    具备高韧性工作流程、证据佐证 RAG、版本化报告与自动化质量评估的 AI 股票研究 Agent。

    1,032-1近 7 天星标变化
  • awesome-evals@benchflow-ai

    一个精选且无废话的最佳 AI 代理构建与评估资源库——论文、博客、演讲、工具、基准测试。由 BenchFlow 维护。

    865+18近 7 天星标变化
← 返回主题列表