evaluation
标记 evaluation 主题、收录中的开源项目,按星标数排序。
- #31
分享我们在管理 Open LLM Leaderboard 与设计 lighteval 期间所积累关于 LLM 评估的实务见解与理论知识!
★ 2,143+2近 7 天星标变化 - #32★ 2,088+0近 7 天星标变化
- #33★ 2,037-2近 7 天星标变化
- #34
指令遵循语言模型的自动评估器。经人工验证、高质量、低成本且快速。
★ 2,012-1近 7 天星标变化 - #35★ 1,846+0近 7 天星标变化
- #36
WFGY 正在迈向 WFGY 5.0 Polaris Protocol,这是一个针对 AI 推理、RAG、Agent 与真实世界工作流程的重大开源版本。包含 Problem Map、Global Debug Card、WFGY 4.0 以及 CFV 彩蛋。
★ 1,786+1近 7 天星标变化 - #37
心理健康大模型 (LLM x Mental Health), Pre & Post-training & Dataset & Evaluation & Depoly & RAG, 搭配 InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM 系列模型
★ 1,781+1近 7 天星标变化 - #38
一个用于构建生产级 Agent 系统的 Go 框架,支持图形工作流程、工具、内存、A2A、AG-UI、MCP、评估与可观测性。
★ 1,760+12近 7 天星标变化 - #39★ 1,668+0近 7 天星标变化
- #40
综述论文 "A Survey on Evaluation of Large Language Models" 的官方 GitHub 页面。
★ 1,608-1近 7 天星标变化 - #41★ 1,506+0近 7 天星标变化
- #42★ 1,391+0近 7 天星标变化
- #43★ 1,300+0近 7 天星标变化
- #44★ 1,260+0近 7 天星标变化
- #45
使用模拟、逼真合成互动来全面诊断与优化 agent 的框架
★ 1,257+0近 7 天星标变化 - #46
KernelBench:LLMs 能写出 GPU Kernels 吗? - 基准测试 + 包含 Torch -> CUDA(以及更多 DSL)的工具包
★ 1,227+7近 7 天星标变化 - #47★ 1,224+0近 7 天星标变化
- #48★ 1,206+0近 7 天星标变化
- #49
PyTorch 中生成式模型的高保真性能指标
★ 1,200+1近 7 天星标变化 - #50
针对 AI agents 的追踪原生 CI/CD — 生产环境失败转化为阻挡 PR 的回归测试。自动检测、分群、封装为隔离案例,在 CI 中以 0 美元重放。
★ 1,176-22近 7 天星标变化 - #51★ 1,156+2近 7 天星标变化
- #52★ 1,155+7近 7 天星标变化
- #53
使用 Prometheus 与 GPT4 评估你的 LLM 响应 💯
★ 1,111+4近 7 天星标变化 - #54
LangSmith 客户端 SDK 实现
★ 1,050+9近 7 天星标变化 - #55
用于可视化数据集、处理数据及评估结果的 SemanticKITTI API。
★ 898+3近 7 天星标变化 - #56
在单一管线中生成高质量合成数据、训练、测量与评估
★ 885+3近 7 天星标变化 - #57
ClawProBench 是一个实时优先的基准测试工具,用于评估 OpenClaw 运行环境中的 LLM 代理,具备确定性评分与重复试验的可靠性。
★ 823+0近 7 天星标变化 - #58★ 820+14近 7 天星标变化
- #59★ 814+1近 7 天星标变化
- #60
Web Codegen Scorer 是一个用来评估 LLM 所生成网页代码质量的工具。
★ 774+4近 7 天星标变化