본문으로 건너뛰기
buildradar
Sign in
토픽 · benchmark

benchmark

benchmark 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 158개
  • PointTinyBenchmark@ucas-vg

    UCAS-VG의 포인트 기반 소형 객체 탐지 및 위치 추적 코드 세트입니다.

    694+0최근 7일 스타 변화
  • long-form-factuality@google-deepmind

    대형 언어 모델의 장문 사실성(long-form factuality)을 벤치마킹합니다. 논문 "Long-form factuality in large language models"의 원본 코드입니다.

    693+2최근 7일 스타 변화
  • Julia 언어를 위한 벤치마킹 프레임워크

    683+1최근 7일 스타 변화
  • VLM2Vec@TIGER-AI-Lab

    VLM2Vec / MMEB (ICLR 2025), VLM2Vec-V2 / MMEB-V2 (TMLR 2026), MMEB-V3 (COLM 2026) 관련 코드를 포함하는 저장소입니다.

    682+2최근 7일 스타 변화
  • openmixup@Westlake-AI

    CAIRI 지도, 준지도 및 자기지도 시각적 표현 학습 툴박스 및 벤치마크

    658+0최근 7일 스타 변화
  • ClawBench@TIGER-AI-Lab

    일상적인 작업에서 브라우저 AI 에이전트를 테스트하기 위한 오픈소스 벤치마크.

    657+40최근 7일 스타 변화
  • Awesome-LLM-Eval: 주로 LLM 평가를 위한 도구, 데이터셋/벤치마크, 데모, 리더보드, 논문, 문서 및 모델의 선별 목록

    656-2최근 7일 스타 변화
  • BenchMARL@facebookresearch

    BenchMARL은 다중 에이전트 강화학습(MARL) 벤치마킹 라이브러리입니다. 재현성과 표준화라는 두 가지 핵심 원칙을 바탕으로 다양한 MARL 알고리즘, 태스크, 모델을 신속하게 비교할 수 있습니다.

    656+0최근 7일 스타 변화
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval)은 Tencent Wukong Code Security Team이 개발한 리포지토리 수준의 AI 생성 코드 보안 평가 벤치마크입니다.

    655+2최근 7일 스타 변화
  • datasets@benedekrozemberczki

    네트워크 과학 및 머신러닝 연구를 위해 수집한 멋진 데이터셋 저장소입니다.

    655+0최근 7일 스타 변화
  • indonlu@IndoNLP

    인도네시아어를 위한 최초의 대규모 자연어 처리 벤치마크. 다양한 다운스트림 작업, 사전 학습된 IndoBERT 모델 및 시작 코드를 제공합니다 (AACL-IJCNLP 2020)

    655+1최근 7일 스타 변화
  • Kotlin 멀티플랫폼 벤치마킹 툴킷

    644+0최근 7일 스타 변화
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: 거대 언어 모델의 신뢰성 연구

    632+2최근 7일 스타 변화
  • AgentLab@ServiceNow

    AgentLab: 다양한 작업에서 웹 에이전트를 개발, 테스트 및 벤치마킹하기 위한 오픈 소스 프레임워크로, 확장성과 재현성을 고려하여 설계되었습니다.

    628+0최근 7일 스타 변화
  • rspec-benchmark@piotrmurach

    RSpec을 위한 성능 테스트 매처

    618+0최근 7일 스타 변화
  • NIID-Bench@Xtra-Computing

    연합 학습 벤치마크 - Non-IID 데이터 사일로에서의 연합 학습: 실험적 연구 (ICDE 2022)

    618+0최근 7일 스타 변화
  • TextClassificationBenchmark@FreedomIntelligence

    PyTorch를 이용한 텍스트 분류 벤치마크

    608+0최근 7일 스타 변화
  • KLUE@KLUE-benchmark

    📖 한국어 NLU 벤치마크

    604+0최근 7일 스타 변화
  • globalping@jsdelivr

    ping, traceroute, DNS resolve와 같은 네트워크 테스트를 실행하기 위한 글로벌 프로브 네트워크입니다.

    597+3최근 7일 스타 변화
  • 시각적 객체 추적

    596+2최근 7일 스타 변화
  • rewrk@lnx-search

    HTTP/1 및 HTTP/2 벤치마크를 지원하는 현대적인 HTTP 프레임워크 벤치마커

    588+1최근 7일 스타 변화
  • CL-bench@Tencent-Hunyuan

    CL-bench: 컨텍스트 학습을 위한 벤치마크

    580+2최근 7일 스타 변화
  • ParseBench@run-llama

    ParseBench - AI 에이전트를 위한 문서 파싱 벤치마크 도구입니다.

    563+6최근 7일 스타 변화
  • alpaca@p-ranav

    C++17로 작성된 직렬화 라이브러리 - 매크로나 보일러플레이트 코드 없이 C++ 구조체를 압축된 바이트 배열로 패킹

    560+0최근 7일 스타 변화
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    559최근 7일 스타 변화
  • 몇 가지 프로그래밍 언어의 단순 성능 비교 (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)

    557+0최근 7일 스타 변화
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: 자동 음성 인식(ASR)을 위한 대규모의 강력하고 포괄적인 벤치마킹 플랫폼입니다.

    553+3최근 7일 스타 변화
  • Meta Agents Research Environments는 동적이고 현실적인 시나리오에서 AI 에이전트를 평가하기 위한 포괄적인 플랫폼입니다. 정적 벤치마크와 달리, 이 플랫폼은 새로운 정보가 제공됨에 따라 에이전트가 전략을 조정해야 하는 진화하는 환경을 도입하여 실제 환경의 도전 과제를 반영합니다.

    550+3최근 7일 스타 변화
  • 기업 내부 문서를 활용한 RAG용 데이터셋 및 벤치마크입니다.

    542+9최근 7일 스타 변화
  • NBench@petabridge

    .NET 애플리케이션을 위한 성능 벤치마킹 및 테스트 프레임워크

    540+0최근 7일 스타 변화
← 토픽 목록으로