본문으로 건너뛰기
buildradar
Sign in
토픽 · llm-evaluation

llm-evaluation

llm-evaluation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
37
총 스타
234,912
평균 스타
6,349
비중
0.01%

같은 리포지토리에 llm-evaluation 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 llm-evaluation 태그가 달린 리포지토리예요.

  • awesome-evals@benchflow-ai

    AI 에이전트 구축 및 평가를 위한 최고의 리소스(논문, 블로그, 강연, 도구, 벤치마크)를 엄선한 실속 있는 라이브러리. BenchFlow에서 유지 관리합니다.

    865
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • KADATH@i3T4AN

    Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

    352
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    오픈소스 AI 엔지니어링 플랫폼: LLM 평가, 관측성, 지표, 프롬프트 관리, 플레이그라운드, 데이터셋. OpenTelemetry, LangChain, OpenAI SDK, LiteLLM 등과 통합. 🍊YC W23

    34,116+207최근 7일 스타 변화
  • mlflow@mlflow

    에이전트, LLM 및 ML 모델을 위한 오픈 소스 AI 엔지니어링 플랫폼. MLflow를 통해 모든 규모의 팀이 비용을 제어하고 모델 및 데이터 접근을 관리하면서 프로덕션 수준의 AI 애플리케이션을 디버깅, 평가, 모니터링 및 최적화할 수 있습니다.

    27,783+55최근 7일 스타 변화
  • promptfoo@promptfoo

    프롬프트, 에이전트 및 RAG 테스트. AI를 위한 레드 티밍/모의 해킹/취약점 스캐닝. GPT, Claude, Gemini, DeepSeek 등의 성능 비교. 명령줄 및 CI/CD 통합을 지원하는 간단한 선언형 설정. OpenAI 및 Anthropic에서 사용 중.

    24,767+103최근 7일 스타 변화
  • opik@comet-ml

    포괄적인 추적, 자동화된 평가, 프로덕션 준비가 완료된 대시보드를 통해 LLM 애플리케이션, RAG 시스템 및 에이전트 워크플로우를 디버깅, 평가 및 모니터링하세요.

    21,752+84최근 7일 스타 변화
  • deepeval@confident-ai

    LLM 평가 프레임워크

    18,063+110최근 7일 스타 변화
  • iFixAi@ifixai-ai

    AI 에이전트 독립 감사. AI 에이전트 경제에서 가장 중요한 질문에 답하기 위해 사람이 직접 또는 에이전트 스스로 실행합니다. 에이전트가 의도대로 작동하고 있나요? iFixAi를 사용하면 120초 이내에 이 질문에 대한 답을 얻을 수 있습니다.

    12,643+1,247최근 7일 스타 변화
  • phoenix@Arize-ai

    AI 관측 가능성 및 평가

    11,298+55최근 7일 스타 변화
  • garak@NVIDIA

    LLM 취약점 스캐너

    9,094+23최근 7일 스타 변화
  • NoneLinear - ReLE 평가: 중국어 AI 대형 모델 성능 평가(지속 업데이트). ChatGPT, GPT-5.4, Google Gemini-3.1-pro, Claude-4.6, Wenxin ERNIE-X1.1, ERNIE-5.0, qwen3.6-max, qwen3.6-plus, Baichuan, iFlytek Spark, SenseChat 등 상용 모델과 step3.5-flash, kimi-k2.6, ernie4.5, MiniMax-M2.7, deepseek-v4, Qwen3.6, llama4, Zhipu GLM-5.1, MiMo-V2, LongCat, gemma4, mistral 등 오픈소스 대형 모델을 포함하여 총 374개의 대형 모델을 수록. 순위표뿐만 아니라 200만 건 이상의 대형 모델 결함 라이브러리도 제공하여 커뮤니티의 연구 분석 및 대형 모델 개선을 지원함.

    6,415+6최근 7일 스타 변화
  • helicone@Helicone

    🧊 오픈소스 LLM 관측 가능성(observability) 플랫폼. 한 줄의 코드로 모니터링, 평가, 실험을 수행하세요. YC W23 🍓

    6,127+11최근 7일 스타 변화
  • AI-Infra-Guard@Tencent

    에이전트 스캔, 스킬 스캔, MCP 스캔, AI 인프라 스캔 및 LLM 탈옥 평가를 통해 AI 생태계를 보호하는 풀스택 AI 레드 테이밍 플랫폼.

    6,117+59최근 7일 스타 변화
  • giskard-oss@Giskard-AI

    🐢 LLM 에이전트를 위한 오픈소스 평가 및 테스트 라이브러리

    5,801+9최근 7일 스타 변화
  • ouroboros@Q00

    Agent OS: 에이전트가 스스로 더 똑똑해집니다. 우리는 단지 채점 명령어와 예상 결과가 성공 계약에 포함되지 않도록 기준을 유지합니다. 인터뷰 관문, 단계별 평가, 예산이 지정된 진화 루프를 제공합니다. MCP 서버, 13개 런타임(Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro 등)을 지원합니다.

    5,753+25최근 7일 스타 변화
  • LLM-Engineers-Handbook@PacktPublishing

    LLM 실전 가이드: 기초부터 LLMOps 모범 사례를 적용하여 AWS에 고급 LLM 및 RAG 앱을 배포하는 방법까지

    5,310+8최근 7일 스타 변화
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: 이제 에이전트가 컴퓨터에서 무엇이든 찾을 수 있습니다. 자주 사용할수록 더 똑똑해집니다.

    5,058+1최근 7일 스타 변화
  • lmms-eval@EvolvingLMMs-Lab

    텍스트, 이미지, 비디오, 오디오 작업을 아우르는 올인원 멀티모달 평가 툴킷

    4,390+7최근 7일 스타 변화
  • AI-Engineer-Headquarters@hemansnation

    스토리와 모델을 구축하기 위한 과학적 방법, 프로세스, 알고리즘 및 시스템 모음입니다.

    3,676+2최근 7일 스타 변화
  • trulens@truera

    LLM 실험 및 AI 에이전트를 위한 평가 및 추적

    3,530+2최근 7일 스타 변화
  • lmnr@lmnr-ai

    Laminar - AI 에이전트 전용으로 구축된 오픈 소스 관측 가능성 플랫폼. YC S24.

    3,219+9최근 7일 스타 변화
  • generative-ai@genieincodebottle

    상세한 로드맵, 프로젝트, 유스케이스, 면접 준비, 코딩 준비를 포함한 생성형 AI에 대한 종합 리소스

    2,610+1최근 7일 스타 변화
  • agentic_security@msoedov

    에이전틱 LLM 취약점 스캐너 / AI 레드 팀 킷 🧪

    1,983+3최근 7일 스타 변화
  • future-agi@future-agi

    LLM 및 AI 에이전트 애플리케이션을 평가, 모니터링, 개선하기 위한 오픈소스 엔드투엔드 플랫폼. 트레이싱, 평가, 시뮬레이션, 데이터셋, 게이트웨이, 가드레일 제공. 자체 호스팅 가능. Apache 2.0.

    1,909+42최근 7일 스타 변화
  • aisheets@huggingface

    노코드로 AI 모델을 사용하여 데이터셋 구축, 보강 및 변환

    1,641-1최근 7일 스타 변화
  • FuzzyAI@cyberark

    자동화된 LLM 퍼징을 위한 강력한 도구. 개발자와 보안 연구자가 LLM API의 잠재적인 탈옥을 식별하고 완화할 수 있도록 설계되었습니다.

    1,573+4최근 7일 스타 변화
  • prompty@microsoft

    Prompty를 사용하면 AI 애플리케이션을 위한 LLM 프롬프트를 쉽게 생성, 관리, 디버깅 및 평가할 수 있습니다. Prompty는 개발자를 위한 관측 가능성, 이해 가능성, 이식성을 향상시키도록 설계된 LLM 프롬프트 자산 클래스이자 포맷입니다.

    1,255+1최근 7일 스타 변화
  • uqlm@cvs-health

    [JMLR 2026] "UQLM: 대형 언어 모델의 불확실성 정량화를 위한 Python 패키지"

    1,194+1최근 7일 스타 변화
  • Tracely-ai@Jwuthri

    AI 에이전트를 위한 트레이스 네이티브 CI/CD — 프로덕션 장애가 PR을 차단하는 회귀 테스트가 됩니다. 자동 감지, 클러스터링, 격리된 케이스로 고정, CI에서 0달러로 재실행.

    1,176-22최근 7일 스타 변화
  • judgeval@JudgmentLabs

    에이전트를 위한 지속적 개선 스택. 환경 데이터와 평가(eval)를 통해 에이전트의 성능 향상과 모니터링을 지원합니다.

    1,060+2최근 7일 스타 변화
  • FinSight-AI@juanjuandog

    안정적인 워크플로우, 근거 기반 RAG, 버전 관리 리포트, 자동 품질 평가 기능을 갖춘 AI 주식 리서치 에이전트.

    1,031-2최근 7일 스타 변화
  • awesome-evals@benchflow-ai

    AI 에이전트 구축 및 평가를 위한 최고의 리소스(논문, 블로그, 강연, 도구, 벤치마크)를 엄선한 실속 있는 라이브러리. BenchFlow에서 유지 관리합니다.

    865+17최근 7일 스타 변화
← 토픽 목록으로