evaluation
标记 evaluation 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 evaluation 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 evaluation 主题的项目。
- #1
The Fable Workflow:提炼 Claude Fable 5 的运作方式,转化为任何模型都能执行的技能,并透过评估机制确保其可靠性。思考 / 行动 / 证明。
★ 2,274 - #2
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #3★ 160
- #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 开源 AI 工程平台:LLM 评估、可观测性、指标、提示管理、游乐场、数据集。整合 OpenTelemetry、LangChain、OpenAI SDK、LiteLLM 等。🍊YC W23
★ 34,116+207近 7 天星标变化 - #2★ 27,783+55近 7 天星标变化
- #3
测试你的提示、代理与检索增强生成,进行 AI 红队/渗透测试/漏洞扫描。比较 GPT、Claude、Gemini、DeepSeek 等表现。使用简洁声明式配置,支持命令行与 CI/CD 集成。OpenAI 与 Anthropic 均有使用。
★ 24,767+103近 7 天星标变化 - #4★ 21,752+84近 7 天星标变化
- #5★ 21,205+306近 7 天星标变化
- #6★ 15,594+53近 7 天星标变化
- #7★ 9,383+3近 7 天星标变化
- #8
OpenCompass 是一个 LLM 评估平台,支持多种模型(Llama3、Mistral、InternLM2、GPT-4、LLaMa2、Qwen、GLM、Claude 等)以及 100 多个数据集
★ 7,388+14近 7 天星标变化 - #9★ 6,127+11近 7 天星标变化
- #10★ 5,711+5近 7 天星标变化
- #11★ 5,058+1近 7 天星标变化
- #12★ 5,042+5近 7 天星标变化
- #13★ 4,390+7近 7 天星标变化
- #14
开源大型多模态模型评估工具包,支持220+ LMMs与80+基准测试
★ 4,375+13近 7 天星标变化 - #15★ 4,311+1近 7 天星标变化
- #16★ 3,522+5近 7 天星标变化
- #17★ 3,414+5近 7 天星标变化
- #18★ 3,356+25近 7 天星标变化
- #19★ 3,299+0近 7 天星标变化
- #20★ 3,219+9近 7 天星标变化
- #21★ 3,134+0近 7 天星标变化
- #22
一个开源的可视化程序设计环境,用于对 LLM 进行对战测试提示。
★ 3,026-2近 7 天星标变化 - #23
YAO = Yielding AI Outcomes。一个用于可重用 agent 技能的严谨工程、评估、治理与移植系统。
★ 2,581+24近 7 天星标变化 - #24★ 2,533+3近 7 天星标变化
- #25★ 2,478-2近 7 天星标变化
- #26
UpTrain 是一个开源的统一平台,用于评估和改善生成式 AI 应用程序。我们提供 20 多项预先配置检查的评分(涵盖语言、代码、嵌入使用案例),对失败案例执行根本原因分析,并提供如何解决这些问题的见解。
★ 2,364+0近 7 天星标变化 - #27
拼好RAG:手搓并融合了GraphRAG、LightRAG、Neo4j-llm-graph-builder进行知识图谱构建以及搜索;整合DeepSearch技术实现私域RAG的推理;自制针对GraphRAG的评估框架 | 整合 GraphRAG、LightRAG 和 Neo4j-llm-graph-builder 进行知识图谱构建与搜索。结合 DeepSearch 进行私有 RAG 推理。创建自定义的 GraphRAG 评估框架。
★ 2,332+3近 7 天星标变化 - #28
The Fable Workflow:提炼 Claude Fable 5 的运作方式,转化为任何模型都能执行的技能,并透过评估机制确保其可靠性。思考 / 行动 / 证明。
★ 2,274+10近 7 天星标变化 - #29★ 2,183+6近 7 天星标变化
- #30
📰 关于基于 LLM 的长上下文建模必读论文与博客 🔥
★ 2,164-1近 7 天星标变化