主题 · evaluation-framework
evaluation-framework
标记 evaluation-framework 主题、收录中的开源项目,按星标数排序。
项目数
10
总星标数
70,935
平均星标数
7,094
占比
0.00%
相关主题
常跟 evaluation-framework 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 evaluation-framework 主题的项目。
- #1
测试你的提示、代理与检索增强生成,进行 AI 红队/渗透测试/漏洞扫描。比较 GPT、Claude、Gemini、DeepSeek 等表现。使用简洁声明式配置,支持命令行与 CI/CD 集成。OpenAI 与 Anthropic 均有使用。
★ 24,767+103近 7 天星标变化 - #2★ 18,063+110近 7 天星标变化
- #3
用于少样本评估语言模型的框架
★ 13,873+46近 7 天星标变化 - #4★ 5,042+5近 7 天星标变化
- #5★ 2,533+3近 7 天星标变化
- #6★ 2,037-2近 7 天星标变化
- #7
开源的端到端平台,用于评估、观察与改进 LLM 及 AI agent 应用程序。包含追踪、评估、模拟、数据集、网关、安全护栏。支持自行架设。采用 Apache 2.0 授权。
★ 1,909+42近 7 天星标变化 - #8
AI Agents 终极指南仓库
★ 1,567+220近 7 天星标变化 - #9★ 629+1近 7 天星标变化
- #10
基于 LLM 应用程序的数据驱动评估
★ 517+1近 7 天星标变化