본문으로 건너뛰기
buildradar
Sign in
토픽 · evaluation

evaluation

evaluation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 80개
  • evaluation-guidebook@huggingface

    Open LLM Leaderboard를 관리하고 lighteval을 설계하면서 얻은 LLM 평가에 관한 실용적인 통찰력과 이론적 지식 공유

    2,143+2최근 7일 스타 변화
  • avalanche@ContinualAI

    Avalanche: PyTorch 기반의 엔드투엔드 지속적 학습 라이브러리

    2,088+0최근 7일 스타 변화
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: 최신 AI 기술(SOTA) 평가

    2,037-2최근 7일 스타 변화
  • alpaca_eval@tatsu-lab

    지시사항을 따르는 언어 모델을 위한 자동 평가기. 인간 검증을 거쳤으며, 고품질이고 저렴하며 빠릅니다.

    2,012-1최근 7일 스타 변화
  • AB3DMOT@xinshuoweng

    "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics" 논문의 공식 Python 구현 (IROS 2020, ECCVW 2020)

    1,846+0최근 7일 스타 변화
  • WFGY@onestardao

    WFGY는 AI 추론, RAG, 에이전트, 실세계 워크플로를 위한 대규모 오픈소스 릴리스인 WFGY 5.0 Polaris Protocol을 향해 나아가고 있습니다. Problem Map, Global Debug Card, WFGY 4.0 및 CFV 이스터 에그가 포함되어 있습니다.

    1,786+1최근 7일 스타 변화
  • EmoLLM@SmartFlowAI

    정신 건강 대규모 언어 모델(LLM x Mental Health), 사전 학습 및 사후 학습, 데이터셋, 평가, 배포, RAG, InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM 시리즈 모델 지원

    1,781+1최근 7일 스타 변화
  • trpc-agent-go@trpc-group

    그래프 워크플로, 도구, 메모리, A2A, AG-UI, MCP, 평가 및 관측 가능성을 갖춘 프로덕션 급 에이전트 시스템 구축을 위한 Go 프레임워크.

    1,760+12최근 7일 스타 변화
  • ragbits@deepsense-ai

    GenAI 애플리케이션의 빠른 개발을 위한 빌딩 블록

    1,668+0최근 7일 스타 변화
  • '대규모 언어 모델 평가에 관한 조사' 논문을 위한 공식 GitHub 페이지

    1,608-1최근 7일 스타 변화
  • pycm@sepandhaghighi

    Python의 다중 클래스 혼동 행렬 라이브러리

    1,506+0최근 7일 스타 변화
  • nlg-eval@Maluuba

    자연어 생성을 위한 다양한 비지도 자동 평가 지표의 평가 코드

    1,391+0최근 7일 스타 변화
  • lispy@abo-abo

    간결하고 편리한 LISP 편집

    1,300+0최근 7일 스타 변화
  • xai@EthicalML

    XAI - 머신러닝을 위한 설명 가능성 툴박스

    1,260+0최근 7일 스타 변화
  • intellagent@plurai-ai

    시뮬레이션된 현실적인 합성 상호작용을 사용하여 에이전트를 종합적으로 진단하고 최적화하기 위한 프레임워크

    1,257+0최근 7일 스타 변화
  • KernelBench@ScalingIntelligence

    KernelBench: LLM이 GPU 커널을 작성할 수 있을까? - Torch -> CUDA(+ 기타 DSL) 벤치마크 및 툴킷

    1,227+7최근 7일 스타 변화
  • kubetorch@run-house

    ML 인프라를 위한 PyTorch처럼, Python에서 Kubernetes로 AI 워크로드 분산 및 실행을 마법처럼 처리

    1,224+0최근 7일 스타 변화
  • fuzzbench@google

    FuzzBench - 서비스 형태의 퍼저 벤치마킹

    1,206+0최근 7일 스타 변화
  • torch-fidelity@toshas

    PyTorch 생성 모델을 위한 고충실도 성능 지표

    1,200+1최근 7일 스타 변화
  • Tracely-ai@Jwuthri

    AI 에이전트를 위한 트레이스 네이티브 CI/CD — 프로덕션 장애가 PR을 차단하는 회귀 테스트가 됩니다. 자동 감지, 클러스터링, 격리된 케이스로 고정, CI에서 0달러로 재실행.

    1,176-22최근 7일 스타 변화
  • ncalc@ncalc

    NCalc는 유연성과 고성능을 위해 설계된 .NET용 빠르고 가벼운 표현식 평가 라이브러리입니다. 다양한 수학 및 논리 연산을 지원합니다.

    1,156+2최근 7일 스타 변화
  • Gym@NVIDIA-NeMo

    환경을 활용한 모델 및 에이전트 평가 및 개선

    1,155+7최근 7일 스타 변화
  • prometheus-eval@prometheus-eval

    Prometheus와 GPT4를 사용하여 LLM의 응답 평가 💯

    1,111+4최근 7일 스타 변화
  • langsmith-sdk@langchain-ai

    LangSmith Client SDK 구현

    1,049+9최근 7일 스타 변화
  • 데이터셋 시각화, 데이터 처리, 결과 평가를 위한 SemanticKITTI API

    898+3최근 7일 스타 변화
  • deepfabric@nolabs-ai

    단일 파이프라인에서 고품질 합성 데이터 생성, 학습, 측정 및 평가

    885+3최근 7일 스타 변화
  • ClawProBench@suyoumo

    ClawProBench는 결정론적 채점 및 반복 테스트 신뢰성을 바탕으로 OpenClaw 런타임에서 LLM 에이전트를 평가하기 위한 라이브 우선(live-first) 벤치마크 도구입니다.

    823+0최근 7일 스타 변화
  • OpenJudge@agentscope-ai

    OpenJudge: 종합적인 평가 및 품질 보상을 위한 통합 프레임워크

    819+14최근 7일 스타 변화
  • gval@PaesslerAG

    Golang을 이용한 수식 평가

    814+1최근 7일 스타 변화
  • web-codegen-scorer@angular

    Web Codegen Scorer는 LLM이 생성한 웹 코드의 품질을 평가하기 위한 도구입니다.

    775+4최근 7일 스타 변화
← 토픽 목록으로