跳到主要内容
buildradar
Sign in
主题 · evaluation

evaluation

标记 evaluation 主题、收录中的开源项目,按星标数排序。

项目数
80
总星标数
292,612
平均星标数
3,658
占比
0.02%

常跟 evaluation 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 evaluation 主题的项目。

  • fable-method@Sahir619

    The Fable Workflow:提炼 Claude Fable 5 的运作方式,转化为任何模型都能执行的技能,并透过评估机制确保其可靠性。思考 / 行动 / 证明。

    2,274
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    160
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 开源 AI 工程平台:LLM 评估、可观测性、指标、提示管理、游乐场、数据集。整合 OpenTelemetry、LangChain、OpenAI SDK、LiteLLM 等。🍊YC W23

    34,116+207近 7 天星标变化
  • mlflow@mlflow

    开源 AI 工程平台,支持代理、LLM 与机器学习模型。MLflow 使各种规模的团队能够调试、评估、监控和优化生产级 AI 应用,同时控制成本并管理模型和数据的访问。

    27,783+55近 7 天星标变化
  • promptfoo@promptfoo

    测试你的提示、代理与检索增强生成,进行 AI 红队/渗透测试/漏洞扫描。比较 GPT、Claude、Gemini、DeepSeek 等表现。使用简洁声明式配置,支持命令行与 CI/CD 集成。OpenAI 与 Anthropic 均有使用。

    24,767+103近 7 天星标变化
  • opik@comet-ml

    调试、评估和监控您的 LLM 应用、RAG 系统与代理工作流,提供完整追踪、自动评估和可投入生产的仪表板。

    21,752+84近 7 天星标变化
  • WeKnora@Tencent

    开源 LLM 知识平台:将原始文档转化为可查询的 RAG、自主推理代理以及自我维护的 Wiki

    21,205+306近 7 天星标变化
  • ragas@vibrantlabsai

    为你的 LLM 应用评估加速 🚀

    15,594+53近 7 天星标变化
  • oumi@oumi-ai

    轻松微调、评估与部署 Qwen、Gemma 或任何开放权重的 LLM!

    9,383+3近 7 天星标变化
  • opencompass@open-compass

    OpenCompass 是一个 LLM 评估平台,支持多种模型(Llama3、Mistral、InternLM2、GPT-4、LLaMa2、Qwen、GLM、Claude 等)以及 100 多个数据集

    7,388+14近 7 天星标变化
  • helicone@Helicone

    🧊 开源 LLM 可观测平台,一行代码即可监控、评估与实验

    6,127+11近 7 天星标变化
  • coze-loop@coze-dev

    下一代 AI 代理优化平台:Cozeloop 提供从开发、调试、评估到监控的全生命周期管理,解决 AI 代理开发挑战。

    5,711+5近 7 天星标变化
  • AutoRAG@Marker-Inc-Korea

    AutoRAG:现在你的代理能在电脑中寻找任何东西,使用频率越高越聪明

    5,058+1近 7 天星标变化
  • Kiln@Kiln-AI

    构建、评估与优化 AI 系统。包含评估、RAG、代理、微调、合成数据生成、数据集管理、MCP 等。

    5,042+5近 7 天星标变化
  • lmms-eval@EvolvingLMMs-Lab

    涵盖文本、图像、视频和音频任务的全能多模态评估工具包

    4,390+7近 7 天星标变化
  • VLMEvalKit@open-compass

    开源大型多模态模型评估工具包,支持220+ LMMs与80+基准测试

    4,375+13近 7 天星标变化
  • evo@MichaelGrupp

    用于评估里程计与 SLAM 的 Python 包

    4,311+1近 7 天星标变化
  • langwatch@langwatch

    LLM 评估与 AI 代理测试的平台

    3,522+5近 7 天星标变化
  • mteb@embeddings-benchmark

    MTEB:跨语言与多模态嵌入的最先进评估

    3,414+5近 7 天星标变化
  • evalscope@modelscope

    一个精简且可自定义的框架,用于高效的大型模型(LLM、VLM、AIGC)评估与性能基准测试。

    3,356+25近 7 天星标变化
  • SuperCLUE@CLUEbenchmark

    SuperCLUE:中文通用大模型综合性基准 | A Benchmark for Foundation Models in Chinese

    3,299+0近 7 天星标变化
  • lmnr@lmnr-ai

    Laminar - 专为 AI agent 打造的开源可观测性平台。YC S24。

    3,219+9近 7 天星标变化
  • klipse@viebel

    Klipse 是一个 JavaScript 插件,用于在技术博客嵌入交互式代码片段

    3,134+0近 7 天星标变化
  • ChainForge@ianarawjo

    一个开源的可视化程序设计环境,用于对 LLM 进行对战测试提示。

    3,026-2近 7 天星标变化
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes。一个用于可重用 agent 技能的严谨工程、评估、治理与移植系统。

    2,581+24近 7 天星标变化
  • lighteval@huggingface

    Lighteval 是您跨多种后端评估 LLM 的全方位工具包

    2,533+3近 7 天星标变化
  • evaluate@huggingface

    🤗 Evaluate:一个用于轻松评估机器学习模型和数据集的库。

    2,478-2近 7 天星标变化
  • uptrain@uptrain-ai

    UpTrain 是一个开源的统一平台,用于评估和改善生成式 AI 应用程序。我们提供 20 多项预先配置检查的评分(涵盖语言、代码、嵌入使用案例),对失败案例执行根本原因分析,并提供如何解决这些问题的见解。

    2,364+0近 7 天星标变化
  • graph-rag-agent@1517005260

    拼好RAG:手搓并融合了GraphRAG、LightRAG、Neo4j-llm-graph-builder进行知识图谱构建以及搜索;整合DeepSearch技术实现私域RAG的推理;自制针对GraphRAG的评估框架 | 整合 GraphRAG、LightRAG 和 Neo4j-llm-graph-builder 进行知识图谱构建与搜索。结合 DeepSearch 进行私有 RAG 推理。创建自定义的 GraphRAG 评估框架。

    2,332+3近 7 天星标变化
  • fable-method@Sahir619

    The Fable Workflow:提炼 Claude Fable 5 的运作方式,转化为任何模型都能执行的技能,并透过评估机制确保其可靠性。思考 / 行动 / 证明。

    2,274+10近 7 天星标变化
  • inspector@MCPJam

    用于对话、检查和调试 MCP servers、MCP apps 与 ChatGPT apps 的测试与评估平台。

    2,183+6近 7 天星标变化
  • 📰 关于基于 LLM 的长上下文建模必读论文与博客 🔥

    2,164-1近 7 天星标变化
← 返回主题列表