主题 · llm-evaluation
llm-evaluation
标记 llm-evaluation 主题、收录中的开源项目,按星标数排序。
共 37 个项目
- #31
适用于 agentskills.io 风格 AI agent 技能的测试运行器
★ 728+8近 7 天星标变化 - #32★ 707+76近 7 天星标变化
- #33
Awesome-LLM-Eval:精选的工具、数据集/基准测试、演示、排行榜、论文、文档与模型列表,主要用于 LLM 评估。一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界。
★ 656+0近 7 天星标变化 - #34
收录社会科学领域中涉及 LLM 相关论文的精选清单。
★ 648+1近 7 天星标变化 - #35
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 646—近 7 天星标变化 - #36
针对公司内部文档进行 RAG 的数据集与基准测试。
★ 548+8近 7 天星标变化 - #37
基于 LLM 应用程序的数据驱动评估
★ 517+0近 7 天星标变化