跳到主要内容
buildradar
登录
主题 · llm-evaluation

llm-evaluation

标记 llm-evaluation 主题、收录中的开源项目,按星标数排序。

共 37 个项目
  • agent-skills-eval@darkrishabh

    适用于 agentskills.io 风格 AI agent 技能的测试运行器

    728+8近 7 天星标变化
  • ClawBench@TIGER-AI-Lab

    用于浏览器 AI 代理日常任务的开源基准测试

    707+76近 7 天星标变化
  • Awesome-LLM-Eval:精选的工具、数据集/基准测试、演示、排行榜、论文、文档与模型列表,主要用于 LLM 评估。一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界。

    656+0近 7 天星标变化
  • 收录社会科学领域中涉及 LLM 相关论文的精选清单。

    648+1近 7 天星标变化
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    646近 7 天星标变化
  • 针对公司内部文档进行 RAG 的数据集与基准测试。

    548+8近 7 天星标变化
  • continuous-eval@relari-ai

    基于 LLM 应用程序的数据驱动评估

    517+0近 7 天星标变化
← 返回主题列表