evaluation
evaluation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #61★ 768+0최근 7일 스타 변화
- #62
[EMNLP 2024 & AAAI 2026] LLM, VLM 및 비디오 생성 모델을 포함한 대규모 모델 압축을 위한 강력한 툴킷입니다.
★ 747+4최근 7일 스타 변화 - #63
🦞 에이전트 추적을 Opik으로 내보내는 OpenClaw 공식 플러그인입니다. 에이전트의 동작, 비용, 토큰, 오류 등을 모니터링할 수 있습니다.
★ 725+0최근 7일 스타 변화 - #64
IOU Tracker의 Python 구현
★ 702+0최근 7일 스타 변화 - #65★ 697+4최근 7일 스타 변화
- #66
대형 언어 모델의 장문 사실성(long-form factuality)을 벤치마킹합니다. 논문 "Long-form factuality in large language models"의 원본 코드입니다.
★ 693+2최근 7일 스타 변화 - #67★ 664+61최근 7일 스타 변화
- #68
Awesome-LLM-Eval: 주로 LLM 평가를 위한 도구, 데이터셋/벤치마크, 데모, 리더보드, 논문, 문서 및 모델의 선별 목록
★ 656-2최근 7일 스타 변화 - #69
AutoPrompt: 마스크 언어 모델을 위한 자동 프롬프트 구성 도구입니다.
★ 641+0최근 7일 스타 변화 - #70★ 632+2최근 7일 스타 변화
- #71
단일 C# 파일로 구현된 간단한 수학 및 유사 C# 표현식 평가기. 간단한 C# 스타일 스크립트 실행도 가능합니다.
★ 630+0최근 7일 스타 변화 - #72
대규모 언어 모델(LLM)의 머신 언리닝을 위한 리소스 저장소
★ 623+0최근 7일 스타 변화 - #73
TCExam은 대학, 학교 및 기업을 위한 컴퓨터 기반 평가(CBT) 시스템으로, 설문조사, 퀴즈, 테스트 및 시험을 작성, 예약, 배포 및 보고할 수 있습니다.
★ 619+0최근 7일 스타 변화 - #74
Python을 위한 간단하고 안전하며 샌드박스화된 확장 가능한 표현식 평가기
★ 611+0최근 7일 스타 변화 - #75
이미지 쌍으로부터 이미지 매칭을 수행하는 다양한 방법을 평가하기 위한 툴박스 저장소입니다.
★ 594+0최근 7일 스타 변화 - #76★ 593+1최근 7일 스타 변화
- #77
질문과 SQL 쿼리가 쌍으로 구성된 데이터셋 모음
★ 588+1최근 7일 스타 변화 - #78
ParseBench - AI 에이전트를 위한 문서 파싱 벤치마크 도구입니다.
★ 565+12최근 7일 스타 변화 - #79
Meta Agents Research Environments는 동적이고 현실적인 시나리오에서 AI 에이전트를 평가하기 위한 포괄적인 플랫폼입니다. 정적 벤치마크와 달리, 이 플랫폼은 새로운 정보가 제공됨에 따라 에이전트가 전략을 조정해야 하는 진화하는 환경을 도입하여 실제 환경의 도전 과제를 반영합니다.
★ 550+3최근 7일 스타 변화 - #80
기업 내부 문서를 활용한 RAG용 데이터셋 및 벤치마크입니다.
★ 545+11최근 7일 스타 변화