llm-evaluation
标记 llm-evaluation 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 llm-evaluation 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 llm-evaluation 主题的项目。
- #1
一个精选且无废话的最佳 AI 代理构建与评估资源库——论文、博客、演讲、工具、基准测试。由 BenchFlow 维护。
★ 865 - #2
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 646 - #3
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
★ 352 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 开源 AI 工程平台:LLM 评估、可观测性、指标、提示管理、游乐场、数据集。整合 OpenTelemetry、LangChain、OpenAI SDK、LiteLLM 等。🍊YC W23
★ 34,116+207近 7 天星标变化 - #2★ 27,783+55近 7 天星标变化
- #3
测试你的提示、代理与检索增强生成,进行 AI 红队/渗透测试/漏洞扫描。比较 GPT、Claude、Gemini、DeepSeek 等表现。使用简洁声明式配置,支持命令行与 CI/CD 集成。OpenAI 与 Anthropic 均有使用。
★ 24,767+103近 7 天星标变化 - #4★ 21,752+84近 7 天星标变化
- #5★ 18,063+110近 7 天星标变化
- #6★ 12,643+1,247近 7 天星标变化
- #7★ 11,298+55近 7 天星标变化
- #8★ 9,094+23近 7 天星标变化
- #9
非线智能 NoneLinear - ReLE评测:中文 AI 大模型能力评测(持续更新):目前已囊括374个大模型,覆盖 chatgpt、gpt-5.4、谷歌 gemini-3.1-pro、Claude-4.6、文心 ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤 senseChat 等商用模型,以及 step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱 GLM-5.1、MiMo-V2、LongCat、gemma4、mistral 等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。
★ 6,415+6近 7 天星标变化 - #10★ 6,127+11近 7 天星标变化
- #11
全栈 AI Red Teaming 平台,通过 Agent Scan、Skills Scan、MCP Scan、AI Infra Scan 以及 LLM jailbreak 评估来保护 AI 生态系统。
★ 6,117+59近 7 天星标变化 - #12
🐢 开源的 LLM 代理评估与测试库
★ 5,801+9近 7 天星标变化 - #13
Agent OS:代理自行变得更聪明。我们只负责接口:等级指令与预期结果不会写入成功合约。面试筛选、阶段评估、预算演化循环。MCP 服务器,支持 13 种运行时:Claude Code、Codex CLI、Gemini CLI、OpenCode、Copilot、Kiro 等。
★ 5,753+25近 7 天星标变化 - #14
LLM 实务指南:从基础到在 AWS 上部署先进 LLM 与 RAG 应用,采用 LLMOps 最佳实践
★ 5,310+8近 7 天星标变化 - #15★ 5,058+1近 7 天星标变化
- #16★ 4,390+7近 7 天星标变化
- #17
一套科学方法、流程、算法与系统,用于构建故事与模型
★ 3,676+2近 7 天星标变化 - #18★ 3,530+2近 7 天星标变化
- #19★ 3,219+9近 7 天星标变化
- #20
生成式 AI 的完整资源,包含详细的路线图、项目、使用案例、面试准备和代码练习。
★ 2,610+1近 7 天星标变化 - #21
Agentic LLM 漏洞扫描器 / AI 红队测试套件 🧪
★ 1,983+3近 7 天星标变化 - #22
开源的端到端平台,用于评估、观察与改进 LLM 及 AI agent 应用程序。包含追踪、评估、模拟、数据集、网关、安全护栏。支持自行架设。采用 Apache 2.0 授权。
★ 1,909+42近 7 天星标变化 - #23★ 1,641-1近 7 天星标变化
- #24★ 1,573+4近 7 天星标变化
- #25
Prompty 让您能轻松为 AI 应用程序创建、管理、调试及评估 LLM prompt。Prompty 是专为 LLM prompt 设计的资产类别与格式,旨在提升开发者的可观测性、可理解性与可移植性。
★ 1,255+1近 7 天星标变化 - #26★ 1,194+1近 7 天星标变化
- #27
针对 AI agents 的追踪原生 CI/CD — 生产环境失败转化为阻挡 PR 的回归测试。自动检测、分群、封装为隔离案例,在 CI 中以 0 美元重放。
★ 1,176-22近 7 天星标变化 - #28★ 1,060+2近 7 天星标变化
- #29
具备高韧性工作流程、证据佐证 RAG、版本化报告与自动化质量评估的 AI 股票研究 Agent。
★ 1,032-1近 7 天星标变化 - #30
一个精选且无废话的最佳 AI 代理构建与评估资源库——论文、博客、演讲、工具、基准测试。由 BenchFlow 维护。
★ 865+18近 7 天星标变化