본문으로 건너뛰기
buildradar
Sign in
토픽 · evaluation

evaluation

evaluation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
80
총 스타
291,588
평균 스타
3,645
비중
0.02%

같은 리포지토리에 evaluation 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 evaluation 태그가 달린 리포지토리예요.

  • fable-method@Sahir619

    The Fable Workflow: Claude Fable 5의 작동 원리를 모든 모델이 실행할 수 있는 스킬로 추출하고, 무결성을 유지하는 평가 시스템을 포함합니다. 생각하기 / 행동하기 / 증명하기.

    2,267
  • Tracely-ai@Jwuthri

    AI 에이전트를 위한 트레이스 네이티브 CI/CD — 프로덕션 장애가 PR을 차단하는 회귀 테스트가 됩니다. 자동 감지, 클러스터링, 격리된 케이스로 고정, CI에서 0달러로 재실행.

    1,159
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    오픈소스 AI 엔지니어링 플랫폼: LLM 평가, 관측성, 지표, 프롬프트 관리, 플레이그라운드, 데이터셋. OpenTelemetry, LangChain, OpenAI SDK, LiteLLM 등과 통합. 🍊YC W23

    33,909+372최근 7일 스타 변화
  • mlflow@mlflow

    에이전트, LLM 및 ML 모델을 위한 오픈 소스 AI 엔지니어링 플랫폼. MLflow를 통해 모든 규모의 팀이 비용을 제어하고 모델 및 데이터 접근을 관리하면서 프로덕션 수준의 AI 애플리케이션을 디버깅, 평가, 모니터링 및 최적화할 수 있습니다.

    27,728+114최근 7일 스타 변화
  • promptfoo@promptfoo

    프롬프트, 에이전트 및 RAG 테스트. AI를 위한 레드 티밍/모의 해킹/취약점 스캐닝. GPT, Claude, Gemini, DeepSeek 등의 성능 비교. 명령줄 및 CI/CD 통합을 지원하는 간단한 선언형 설정. OpenAI 및 Anthropic에서 사용 중.

    24,664+215최근 7일 스타 변화
  • opik@comet-ml

    포괄적인 추적, 자동화된 평가, 프로덕션 준비가 완료된 대시보드를 통해 LLM 애플리케이션, RAG 시스템 및 에이전트 워크플로우를 디버깅, 평가 및 모니터링하세요.

    21,668+143최근 7일 스타 변화
  • WeKnora@Tencent

    오픈소스 LLM 지식 플랫폼: 원시 문서를 쿼리 가능한 RAG, 자율 추론 에이전트, 자체 유지 관리되는 위키로 전환합니다.

    20,899+581최근 7일 스타 변화
  • ragas@vibrantlabsai

    LLM 애플리케이션 평가 기능 강화 🚀

    15,541+123최근 7일 스타 변화
  • oumi@oumi-ai

    Qwen, Gemma 또는 모든 오픈 웨이트 LLM을 손쉽게 파인튜닝, 평가 및 배포하세요!

    9,380+3최근 7일 스타 변화
  • opencompass@open-compass

    OpenCompass는 100개 이상의 데이터셋을 바탕으로 Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude 등 다양한 모델을 지원하는 LLM 평가 플랫폼입니다.

    7,374+48최근 7일 스타 변화
  • helicone@Helicone

    🧊 오픈소스 LLM 관측 가능성(observability) 플랫폼. 한 줄의 코드로 모니터링, 평가, 실험을 수행하세요. YC W23 🍓

    6,116+23최근 7일 스타 변화
  • coze-loop@coze-dev

    차세대 AI Agent 최적화 플랫폼: Cozeloop은 개발, 디버깅, 평가부터 모니터링까지 전체 라이프사이클 관리 기능을 제공하여 AI agent 개발의 어려움을 해결합니다.

    5,706+7최근 7일 스타 변화
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: 이제 에이전트가 컴퓨터에서 무엇이든 찾을 수 있습니다. 자주 사용할수록 더 똑똑해집니다.

    5,057+7최근 7일 스타 변화
  • Kiln@Kiln-AI

    AI 시스템 구축, 평가 및 최적화. 평가, RAG, 에이전트, 파인튜닝, 합성 데이터 생성, 데이터셋 관리, MCP 등을 포함합니다.

    5,037+7최근 7일 스타 변화
  • lmms-eval@EvolvingLMMs-Lab

    텍스트, 이미지, 비디오, 오디오 작업을 아우르는 올인원 멀티모달 평가 툴킷

    4,383+11최근 7일 스타 변화
  • VLMEvalKit@open-compass

    대규모 멀티모달 모델(LMM)을 위한 오픈소스 평가 툴킷, 220개 이상의 LMM과 80개 이상의 벤치마크 지원

    4,362+10최근 7일 스타 변화
  • evo@MichaelGrupp

    오도메트리 및 SLAM 평가를 위한 Python 패키지

    4,310+7최근 7일 스타 변화
  • langwatch@langwatch

    LLM 평가 및 AI 에이전트 테스트를 위한 플랫폼

    3,517+13최근 7일 스타 변화
  • mteb@embeddings-benchmark

    MTEB: 다양한 언어와 모달리티에 걸친 임베딩의 최첨단 평가

    3,409+9최근 7일 스타 변화
  • evalscope@modelscope

    효율적인 대형 모델(LLM, VLM, AIGC) 평가 및 성능 벤치마킹을 위한 간소화되고 사용자 정의 가능한 프레임워크입니다.

    3,331+47최근 7일 스타 변화
  • SuperCLUE@CLUEbenchmark

    SuperCLUE: 중국어 범용 대규모 언어 모델 종합 벤치마크

    3,299-1최근 7일 스타 변화
  • lmnr@lmnr-ai

    Laminar - AI 에이전트 전용으로 구축된 오픈 소스 관측 가능성 플랫폼. YC S24.

    3,210+24최근 7일 스타 변화
  • klipse@viebel

    Klipse는 기술 블로그에 인터랙티브 코드 스니펫을 삽입하기 위한 JavaScript 플러그인입니다.

    3,134+0최근 7일 스타 변화
  • ChainForge@ianarawjo

    LLM 프롬프트를 실전 테스트하기 위한 오픈 소스 시각적 프로그래밍 환경입니다.

    3,028+1최근 7일 스타 변화
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes. 재사용 가능한 에이전트 스킬을 위한 엄격한 엔지니어링, 평가, 거버넌스 및 이식성 시스템입니다.

    2,557+160최근 7일 스타 변화
  • lighteval@huggingface

    Lighteval은 다양한 백엔드에서 LLM을 평가하기 위한 올인원 툴킷입니다

    2,530+8최근 7일 스타 변화
  • evaluate@huggingface

    🤗 Evaluate: 머신러닝 모델과 데이터셋을 손쉽게 평가하기 위한 라이브러리입니다.

    2,480+2최근 7일 스타 변화
  • uptrain@uptrain-ai

    UpTrain은 생성형 AI 애플리케이션을 평가하고 개선하기 위한 오픈소스 통합 플랫폼입니다. 20개 이상의 사전 구성된 검사(언어, 코드, 임베디드 사용 사례 포함)에 대한 등급을 제공하고, 실패 사례에 대한 원인 분석을 수행하며, 이를 해결하는 방법에 대한 통찰력을 제공합니다.

    2,364+3최근 7일 스타 변화
  • graph-rag-agent@1517005260

    RAG 구축: GraphRAG, LightRAG, Neo4j-llm-graph-builder를 통합하여 지식 그래프 구축 및 검색 수행; DeepSearch 기술을 통합하여 프라이빗 RAG 추론 구현; GraphRAG용 자체 평가 프레임워크 제작

    2,330+8최근 7일 스타 변화
  • fable-method@Sahir619

    The Fable Workflow: Claude Fable 5의 작동 원리를 모든 모델이 실행할 수 있는 스킬로 추출하고, 무결성을 유지하는 평가 시스템을 포함합니다. 생각하기 / 행동하기 / 증명하기.

    2,267+23최근 7일 스타 변화
  • inspector@MCPJam

    MCP 서버, MCP 앱 및 ChatGPT 앱을 채팅, 검사, 디버깅하기 위한 테스트 및 평가 플랫폼.

    2,177+23최근 7일 스타 변화
  • 📰 LLM 기반 getLong Context Modeling 관련 필독 논문 및 블로그 모음 🔥

    2,165+2최근 7일 스타 변화
← 토픽 목록으로