evaluation
标记 evaluation 主题、收录中的开源项目,按星标数排序。
- #61★ 768+0近 7 天星标变化
- #62
[EMNLP 2024 & AAAI 2026] 一个强大的大型模型压缩工具包,包含 LLM、VLM 及视频生成模型。
★ 747+3近 7 天星标变化 - #63
🦞 OpenClaw 的官方插件,可将 agent 追踪记录导出至 Opik。检视并监控 agent 的行为、成本、token、错误等信息。
★ 725+0近 7 天星标变化 - #64
IOU Tracker 的 Python 实现
★ 702+0近 7 天星标变化 - #65★ 698+2近 7 天星标变化
- #66
评测大型语言模型中的长文本事实准确性。我们论文“Long-form factuality in large language models”的原始代码。
★ 693+0近 7 天星标变化 - #67★ 691+60近 7 天星标变化
- #68
Awesome-LLM-Eval:精选的工具、数据集/基准测试、演示、排行榜、论文、文档与模型列表,主要用于 LLM 评估。一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界。
★ 656+0近 7 天星标变化 - #69
AutoPrompt:针对掩码语言模型的自动提示词构建。
★ 641+0近 7 天星标变化 - #70★ 632+0近 7 天星标变化
- #71
单一 C# 文件中的简单数学与伪 C# 表达式求值器。亦可执行类似 C# 的小型脚本
★ 630+0近 7 天星标变化 - #72
大型语言模型机器遗忘(machine unlearning)资源库
★ 624+1近 7 天星标变化 - #73★ 621+2近 7 天星标变化
- #74
适用于 Python 的简单、安全、沙箱化、可扩展的表达式求值器
★ 611+0近 7 天星标变化 - #75
这是一个工具箱仓库,用于协助评估从一对图像进行图像匹配的各种方法。
★ 594+0近 7 天星标变化 - #76
此仓库包含论文“MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI”的评估代码
★ 594+1近 7 天星标变化 - #77
包含问题与 SQL 查询配对的数据集集合
★ 588+0近 7 天星标变化 - #78
ParseBench - 用于 AI Agent 的文档解析基准测试。
★ 567+9近 7 天星标变化 - #79
Meta Agents Research Environments 是一个综合平台,旨在评估动态、真实场景中的 AI 代理。与静态基准测试不同,此平台引入了不断演进的环境,代理必须随着新信息的出现调整策略,以反映现实世界的挑战。
★ 551+1近 7 天星标变化 - #80
针对公司内部文档进行 RAG 的数据集与基准测试。
★ 548+8近 7 天星标变化