본문으로 건너뛰기
buildradar
Sign in
토픽 · evaluation

evaluation

evaluation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 80개
  • RAG-FiT@IntelLabs

    파인튜닝을 통해 RAG 작업을 위한 LLM을 강화하는 프레임워크

    768+0최근 7일 스타 변화
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] LLM, VLM 및 비디오 생성 모델을 포함한 대규모 모델 압축을 위한 강력한 툴킷입니다.

    747+4최근 7일 스타 변화
  • opik-openclaw@comet-ml

    🦞 에이전트 추적을 Opik으로 내보내는 OpenClaw 공식 플러그인입니다. 에이전트의 동작, 비용, 토큰, 오류 등을 모니터링할 수 있습니다.

    725+0최근 7일 스타 변화
  • iou-tracker@bochinski

    IOU Tracker의 Python 구현

    702+0최근 7일 스타 변화
  • ranx@AmenRa

    ⚡️랭킹 평가, 비교, 융합을 위한 초고속 Python 라이브러리 🐍

    697+4최근 7일 스타 변화
  • long-form-factuality@google-deepmind

    대형 언어 모델의 장문 사실성(long-form factuality)을 벤치마킹합니다. 논문 "Long-form factuality in large language models"의 원본 코드입니다.

    693+2최근 7일 스타 변화
  • ClawBench@TIGER-AI-Lab

    일상적인 작업에서 브라우저 AI 에이전트를 테스트하기 위한 오픈소스 벤치마크.

    664+61최근 7일 스타 변화
  • Awesome-LLM-Eval: 주로 LLM 평가를 위한 도구, 데이터셋/벤치마크, 데모, 리더보드, 논문, 문서 및 모델의 선별 목록

    656-2최근 7일 스타 변화
  • autoprompt@ucinlp

    AutoPrompt: 마스크 언어 모델을 위한 자동 프롬프트 구성 도구입니다.

    641+0최근 7일 스타 변화
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: 거대 언어 모델의 신뢰성 연구

    632+2최근 7일 스타 변화
  • 단일 C# 파일로 구현된 간단한 수학 및 유사 C# 표현식 평가기. 간단한 C# 스타일 스크립트 실행도 가능합니다.

    630+0최근 7일 스타 변화
  • 대규모 언어 모델(LLM)의 머신 언리닝을 위한 리소스 저장소

    623+0최근 7일 스타 변화
  • tcexam@tecnickcom

    TCExam은 대학, 학교 및 기업을 위한 컴퓨터 기반 평가(CBT) 시스템으로, 설문조사, 퀴즈, 테스트 및 시험을 작성, 예약, 배포 및 보고할 수 있습니다.

    619+0최근 7일 스타 변화
  • simpleeval@danthedeckie

    Python을 위한 간단하고 안전하며 샌드박스화된 확장 가능한 표현식 평가기

    611+0최근 7일 스타 변화
  • image-matching-toolbox@GrumpyZhou

    이미지 쌍으로부터 이미지 매칭을 수행하는 다양한 방법을 평가하기 위한 툴박스 저장소입니다.

    594+0최근 7일 스타 변화
  • MMMU@MMMU-Benchmark

    이 저장소는 "MMMU: 전문가 수준 AGI를 위한 대규모 다학제 멀티모달 이해 및 추론 벤치마크" 논문의 평가 코드를 포함합니다.

    593+1최근 7일 스타 변화
  • text2sql-data@jkkummerfeld

    질문과 SQL 쿼리가 쌍으로 구성된 데이터셋 모음

    588+1최근 7일 스타 변화
  • ParseBench@run-llama

    ParseBench - AI 에이전트를 위한 문서 파싱 벤치마크 도구입니다.

    565+12최근 7일 스타 변화
  • Meta Agents Research Environments는 동적이고 현실적인 시나리오에서 AI 에이전트를 평가하기 위한 포괄적인 플랫폼입니다. 정적 벤치마크와 달리, 이 플랫폼은 새로운 정보가 제공됨에 따라 에이전트가 전략을 조정해야 하는 진화하는 환경을 도입하여 실제 환경의 도전 과제를 반영합니다.

    550+3최근 7일 스타 변화
  • 기업 내부 문서를 활용한 RAG용 데이터셋 및 벤치마크입니다.

    545+11최근 7일 스타 변화
← 토픽 목록으로