跳到主要內容
buildradar
登入
主題 · llm-evaluation

llm-evaluation

標記 llm-evaluation 主題、收錄中的開源專案,依星數排序。

共 37 個專案
  • agent-skills-eval@darkrishabh

    適用於 agentskills.io 風格 AI agent 技能的測試執行器

    728+8近 7 天星數變化
  • ClawBench@TIGER-AI-Lab

    用於瀏覽器 AI 代理日常任務的開源基準測試

    691+60近 7 天星數變化
  • Awesome-LLM-Eval:精選的工具、資料集/基準測試、展示、排行榜、論文、文件與模型清單,主要用於 LLM 評估。一個由工具、基準/數據、演示、排行榜和大模型等組成的精選列表,主要面向基礎大模型評測,旨在探求生成式AI的技術邊界。

    656+0近 7 天星數變化
  • 收錄社會科學領域中涉及 LLM 相關論文的精選清單。

    648+1近 7 天星數變化
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    646近 7 天星數變化
  • 針對公司內部文件進行 RAG 的資料集與基準測試。

    548+8近 7 天星數變化
  • continuous-eval@relari-ai

    基於 LLM 應用程式的資料驅動評估

    517+0近 7 天星數變化
← 返回主題列表