跳到主要内容
buildradar
Sign in
主题 · evaluation

evaluation

标记 evaluation 主题、收录中的开源项目,按星标数排序。

共 80 个项目
  • RAG-FiT@IntelLabs

    使用微调增强 LLM 以执行 RAG 任务的框架。

    768+0近 7 天星标变化
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] 一个强大的大型模型压缩工具包,包含 LLM、VLM 及视频生成模型。

    747+3近 7 天星标变化
  • opik-openclaw@comet-ml

    🦞 OpenClaw 的官方插件,可将 agent 追踪记录导出至 Opik。检视并监控 agent 的行为、成本、token、错误等信息。

    725+0近 7 天星标变化
  • iou-tracker@bochinski

    IOU Tracker 的 Python 实现

    702+0近 7 天星标变化
  • ranx@AmenRa

    ⚡️ 用于排序评估、比较与融合的极速 Python 库 🐍

    698+2近 7 天星标变化
  • long-form-factuality@google-deepmind

    评测大型语言模型中的长文本事实准确性。我们论文“Long-form factuality in large language models”的原始代码。

    693+0近 7 天星标变化
  • ClawBench@TIGER-AI-Lab

    用于浏览器 AI 代理日常任务的开源基准测试

    691+60近 7 天星标变化
  • Awesome-LLM-Eval:精选的工具、数据集/基准测试、演示、排行榜、论文、文档与模型列表,主要用于 LLM 评估。一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界。

    656+0近 7 天星标变化
  • autoprompt@ucinlp

    AutoPrompt:针对掩码语言模型的自动提示词构建。

    641+0近 7 天星标变化
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM:大型语言模型的信任度

    632+0近 7 天星标变化
  • 单一 C# 文件中的简单数学与伪 C# 表达式求值器。亦可执行类似 C# 的小型脚本

    630+0近 7 天星标变化
  • 大型语言模型机器遗忘(machine unlearning)资源库

    624+1近 7 天星标变化
  • tcexam@tecnickcom

    TCExam 是一个适用于大学、学校和企业的电脑化评量系统(电子考试、CBT),让教育工作者与培训师能够建立、排程、执行并报告调查、测验、测试与考试。

    621+2近 7 天星标变化
  • simpleeval@danthedeckie

    适用于 Python 的简单、安全、沙箱化、可扩展的表达式求值器

    611+0近 7 天星标变化
  • image-matching-toolbox@GrumpyZhou

    这是一个工具箱仓库,用于协助评估从一对图像进行图像匹配的各种方法。

    594+0近 7 天星标变化
  • MMMU@MMMU-Benchmark

    此仓库包含论文“MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI”的评估代码

    594+1近 7 天星标变化
  • text2sql-data@jkkummerfeld

    包含问题与 SQL 查询配对的数据集集合

    588+0近 7 天星标变化
  • ParseBench@run-llama

    ParseBench - 用于 AI Agent 的文档解析基准测试。

    567+9近 7 天星标变化
  • Meta Agents Research Environments 是一个综合平台,旨在评估动态、真实场景中的 AI 代理。与静态基准测试不同,此平台引入了不断演进的环境,代理必须随着新信息的出现调整策略,以反映现实世界的挑战。

    551+1近 7 天星标变化
  • 针对公司内部文档进行 RAG 的数据集与基准测试。

    548+8近 7 天星标变化
← 返回主题列表