benchmark
benchmark 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #121
UCAS-VG의 포인트 기반 소형 객체 탐지 및 위치 추적 코드 세트입니다.
★ 694+0최근 7일 스타 변화 - #122
대형 언어 모델의 장문 사실성(long-form factuality)을 벤치마킹합니다. 논문 "Long-form factuality in large language models"의 원본 코드입니다.
★ 693+2최근 7일 스타 변화 - #123
Julia 언어를 위한 벤치마킹 프레임워크
★ 683+1최근 7일 스타 변화 - #124
VLM2Vec / MMEB (ICLR 2025), VLM2Vec-V2 / MMEB-V2 (TMLR 2026), MMEB-V3 (COLM 2026) 관련 코드를 포함하는 저장소입니다.
★ 682+2최근 7일 스타 변화 - #125★ 658+0최근 7일 스타 변화
- #126★ 657+40최근 7일 스타 변화
- #127
Awesome-LLM-Eval: 주로 LLM 평가를 위한 도구, 데이터셋/벤치마크, 데모, 리더보드, 논문, 문서 및 모델의 선별 목록
★ 656-2최근 7일 스타 변화 - #128
BenchMARL은 다중 에이전트 강화학습(MARL) 벤치마킹 라이브러리입니다. 재현성과 표준화라는 두 가지 핵심 원칙을 바탕으로 다양한 MARL 알고리즘, 태스크, 모델을 신속하게 비교할 수 있습니다.
★ 656+0최근 7일 스타 변화 - #129
A.S.E (AICGSecEval)은 Tencent Wukong Code Security Team이 개발한 리포지토리 수준의 AI 생성 코드 보안 평가 벤치마크입니다.
★ 655+2최근 7일 스타 변화 - #130★ 655+0최근 7일 스타 변화
- #131
인도네시아어를 위한 최초의 대규모 자연어 처리 벤치마크. 다양한 다운스트림 작업, 사전 학습된 IndoBERT 모델 및 시작 코드를 제공합니다 (AACL-IJCNLP 2020)
★ 655+1최근 7일 스타 변화 - #132
Kotlin 멀티플랫폼 벤치마킹 툴킷
★ 644+0최근 7일 스타 변화 - #133★ 632+2최근 7일 스타 변화
- #134
AgentLab: 다양한 작업에서 웹 에이전트를 개발, 테스트 및 벤치마킹하기 위한 오픈 소스 프레임워크로, 확장성과 재현성을 고려하여 설계되었습니다.
★ 628+0최근 7일 스타 변화 - #135
RSpec을 위한 성능 테스트 매처
★ 618+0최근 7일 스타 변화 - #136
연합 학습 벤치마크 - Non-IID 데이터 사일로에서의 연합 학습: 실험적 연구 (ICDE 2022)
★ 618+0최근 7일 스타 변화 - #137
PyTorch를 이용한 텍스트 분류 벤치마크
★ 608+0최근 7일 스타 변화 - #138★ 604+0최근 7일 스타 변화
- #139
ping, traceroute, DNS resolve와 같은 네트워크 테스트를 실행하기 위한 글로벌 프로브 네트워크입니다.
★ 597+3최근 7일 스타 변화 - #140
시각적 객체 추적
★ 596+2최근 7일 스타 변화 - #141★ 588+1최근 7일 스타 변화
- #142★ 580+2최근 7일 스타 변화
- #143
ParseBench - AI 에이전트를 위한 문서 파싱 벤치마크 도구입니다.
★ 563+6최근 7일 스타 변화 - #144★ 560+0최근 7일 스타 변화
- #145
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 559—최근 7일 스타 변화 - #146
몇 가지 프로그래밍 언어의 단순 성능 비교 (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)
★ 557+0최근 7일 스타 변화 - #147
SpeechIO Leaderboard: 자동 음성 인식(ASR)을 위한 대규모의 강력하고 포괄적인 벤치마킹 플랫폼입니다.
★ 553+3최근 7일 스타 변화 - #148
Meta Agents Research Environments는 동적이고 현실적인 시나리오에서 AI 에이전트를 평가하기 위한 포괄적인 플랫폼입니다. 정적 벤치마크와 달리, 이 플랫폼은 새로운 정보가 제공됨에 따라 에이전트가 전략을 조정해야 하는 진화하는 환경을 도입하여 실제 환경의 도전 과제를 반영합니다.
★ 550+3최근 7일 스타 변화 - #149
기업 내부 문서를 활용한 RAG용 데이터셋 및 벤치마크입니다.
★ 542+9최근 7일 스타 변화 - #150★ 540+0최근 7일 스타 변화