evaluation
evaluation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #31
Open LLM Leaderboard를 관리하고 lighteval을 설계하면서 얻은 LLM 평가에 관한 실용적인 통찰력과 이론적 지식 공유
★ 2,143+2최근 7일 스타 변화 - #32★ 2,088+0최근 7일 스타 변화
- #33★ 2,037-2최근 7일 스타 변화
- #34
지시사항을 따르는 언어 모델을 위한 자동 평가기. 인간 검증을 거쳤으며, 고품질이고 저렴하며 빠릅니다.
★ 2,012-1최근 7일 스타 변화 - #35
"3D Multi-Object Tracking: A Baseline and New Evaluation Metrics" 논문의 공식 Python 구현 (IROS 2020, ECCVW 2020)
★ 1,846+0최근 7일 스타 변화 - #36
WFGY는 AI 추론, RAG, 에이전트, 실세계 워크플로를 위한 대규모 오픈소스 릴리스인 WFGY 5.0 Polaris Protocol을 향해 나아가고 있습니다. Problem Map, Global Debug Card, WFGY 4.0 및 CFV 이스터 에그가 포함되어 있습니다.
★ 1,786+1최근 7일 스타 변화 - #37
정신 건강 대규모 언어 모델(LLM x Mental Health), 사전 학습 및 사후 학습, 데이터셋, 평가, 배포, RAG, InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM 시리즈 모델 지원
★ 1,781+1최근 7일 스타 변화 - #38
그래프 워크플로, 도구, 메모리, A2A, AG-UI, MCP, 평가 및 관측 가능성을 갖춘 프로덕션 급 에이전트 시스템 구축을 위한 Go 프레임워크.
★ 1,760+12최근 7일 스타 변화 - #39★ 1,668+0최근 7일 스타 변화
- #40
'대규모 언어 모델 평가에 관한 조사' 논문을 위한 공식 GitHub 페이지
★ 1,608-1최근 7일 스타 변화 - #41★ 1,506+0최근 7일 스타 변화
- #42★ 1,391+0최근 7일 스타 변화
- #43★ 1,300+0최근 7일 스타 변화
- #44★ 1,260+0최근 7일 스타 변화
- #45
시뮬레이션된 현실적인 합성 상호작용을 사용하여 에이전트를 종합적으로 진단하고 최적화하기 위한 프레임워크
★ 1,257+0최근 7일 스타 변화 - #46
KernelBench: LLM이 GPU 커널을 작성할 수 있을까? - Torch -> CUDA(+ 기타 DSL) 벤치마크 및 툴킷
★ 1,227+7최근 7일 스타 변화 - #47★ 1,224+0최근 7일 스타 변화
- #48★ 1,206+0최근 7일 스타 변화
- #49
PyTorch 생성 모델을 위한 고충실도 성능 지표
★ 1,200+1최근 7일 스타 변화 - #50
AI 에이전트를 위한 트레이스 네이티브 CI/CD — 프로덕션 장애가 PR을 차단하는 회귀 테스트가 됩니다. 자동 감지, 클러스터링, 격리된 케이스로 고정, CI에서 0달러로 재실행.
★ 1,176-22최근 7일 스타 변화 - #51★ 1,156+2최근 7일 스타 변화
- #52★ 1,155+7최근 7일 스타 변화
- #53
Prometheus와 GPT4를 사용하여 LLM의 응답 평가 💯
★ 1,111+4최근 7일 스타 변화 - #54
LangSmith Client SDK 구현
★ 1,049+9최근 7일 스타 변화 - #55
데이터셋 시각화, 데이터 처리, 결과 평가를 위한 SemanticKITTI API
★ 898+3최근 7일 스타 변화 - #56
단일 파이프라인에서 고품질 합성 데이터 생성, 학습, 측정 및 평가
★ 885+3최근 7일 스타 변화 - #57
ClawProBench는 결정론적 채점 및 반복 테스트 신뢰성을 바탕으로 OpenClaw 런타임에서 LLM 에이전트를 평가하기 위한 라이브 우선(live-first) 벤치마크 도구입니다.
★ 823+0최근 7일 스타 변화 - #58★ 819+14최근 7일 스타 변화
- #59★ 814+1최근 7일 스타 변화
- #60
Web Codegen Scorer는 LLM이 생성한 웹 코드의 품질을 평가하기 위한 도구입니다.
★ 775+4최근 7일 스타 변화