llm-evaluation
llm-evaluation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 llm-evaluation 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 llm-evaluation 태그가 달린 리포지토리예요.
- #1
AI 에이전트 구축 및 평가를 위한 최고의 리소스(논문, 블로그, 강연, 도구, 벤치마크)를 엄선한 실속 있는 라이브러리. BenchFlow에서 유지 관리합니다.
★ 865 - #2
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594 - #3
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
★ 352 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
오픈소스 AI 엔지니어링 플랫폼: LLM 평가, 관측성, 지표, 프롬프트 관리, 플레이그라운드, 데이터셋. OpenTelemetry, LangChain, OpenAI SDK, LiteLLM 등과 통합. 🍊YC W23
★ 34,116+207최근 7일 스타 변화 - #2
에이전트, LLM 및 ML 모델을 위한 오픈 소스 AI 엔지니어링 플랫폼. MLflow를 통해 모든 규모의 팀이 비용을 제어하고 모델 및 데이터 접근을 관리하면서 프로덕션 수준의 AI 애플리케이션을 디버깅, 평가, 모니터링 및 최적화할 수 있습니다.
★ 27,783+55최근 7일 스타 변화 - #3
프롬프트, 에이전트 및 RAG 테스트. AI를 위한 레드 티밍/모의 해킹/취약점 스캐닝. GPT, Claude, Gemini, DeepSeek 등의 성능 비교. 명령줄 및 CI/CD 통합을 지원하는 간단한 선언형 설정. OpenAI 및 Anthropic에서 사용 중.
★ 24,767+103최근 7일 스타 변화 - #4
포괄적인 추적, 자동화된 평가, 프로덕션 준비가 완료된 대시보드를 통해 LLM 애플리케이션, RAG 시스템 및 에이전트 워크플로우를 디버깅, 평가 및 모니터링하세요.
★ 21,752+84최근 7일 스타 변화 - #5★ 18,063+110최근 7일 스타 변화
- #6
AI 에이전트 독립 감사. AI 에이전트 경제에서 가장 중요한 질문에 답하기 위해 사람이 직접 또는 에이전트 스스로 실행합니다. 에이전트가 의도대로 작동하고 있나요? iFixAi를 사용하면 120초 이내에 이 질문에 대한 답을 얻을 수 있습니다.
★ 12,643+1,247최근 7일 스타 변화 - #7★ 11,298+55최근 7일 스타 변화
- #8★ 9,094+23최근 7일 스타 변화
- #9
NoneLinear - ReLE 평가: 중국어 AI 대형 모델 성능 평가(지속 업데이트). ChatGPT, GPT-5.4, Google Gemini-3.1-pro, Claude-4.6, Wenxin ERNIE-X1.1, ERNIE-5.0, qwen3.6-max, qwen3.6-plus, Baichuan, iFlytek Spark, SenseChat 등 상용 모델과 step3.5-flash, kimi-k2.6, ernie4.5, MiniMax-M2.7, deepseek-v4, Qwen3.6, llama4, Zhipu GLM-5.1, MiMo-V2, LongCat, gemma4, mistral 등 오픈소스 대형 모델을 포함하여 총 374개의 대형 모델을 수록. 순위표뿐만 아니라 200만 건 이상의 대형 모델 결함 라이브러리도 제공하여 커뮤니티의 연구 분석 및 대형 모델 개선을 지원함.
★ 6,415+6최근 7일 스타 변화 - #10★ 6,127+11최근 7일 스타 변화
- #11
에이전트 스캔, 스킬 스캔, MCP 스캔, AI 인프라 스캔 및 LLM 탈옥 평가를 통해 AI 생태계를 보호하는 풀스택 AI 레드 테이밍 플랫폼.
★ 6,117+59최근 7일 스타 변화 - #12
🐢 LLM 에이전트를 위한 오픈소스 평가 및 테스트 라이브러리
★ 5,801+9최근 7일 스타 변화 - #13
Agent OS: 에이전트가 스스로 더 똑똑해집니다. 우리는 단지 채점 명령어와 예상 결과가 성공 계약에 포함되지 않도록 기준을 유지합니다. 인터뷰 관문, 단계별 평가, 예산이 지정된 진화 루프를 제공합니다. MCP 서버, 13개 런타임(Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro 등)을 지원합니다.
★ 5,753+25최근 7일 스타 변화 - #14
LLM 실전 가이드: 기초부터 LLMOps 모범 사례를 적용하여 AWS에 고급 LLM 및 RAG 앱을 배포하는 방법까지
★ 5,310+8최근 7일 스타 변화 - #15★ 5,058+1최근 7일 스타 변화
- #16★ 4,390+7최근 7일 스타 변화
- #17
스토리와 모델을 구축하기 위한 과학적 방법, 프로세스, 알고리즘 및 시스템 모음입니다.
★ 3,676+2최근 7일 스타 변화 - #18★ 3,530+2최근 7일 스타 변화
- #19★ 3,219+9최근 7일 스타 변화
- #20
상세한 로드맵, 프로젝트, 유스케이스, 면접 준비, 코딩 준비를 포함한 생성형 AI에 대한 종합 리소스
★ 2,610+1최근 7일 스타 변화 - #21
에이전틱 LLM 취약점 스캐너 / AI 레드 팀 킷 🧪
★ 1,983+3최근 7일 스타 변화 - #22
LLM 및 AI 에이전트 애플리케이션을 평가, 모니터링, 개선하기 위한 오픈소스 엔드투엔드 플랫폼. 트레이싱, 평가, 시뮬레이션, 데이터셋, 게이트웨이, 가드레일 제공. 자체 호스팅 가능. Apache 2.0.
★ 1,909+42최근 7일 스타 변화 - #23★ 1,641-1최근 7일 스타 변화
- #24★ 1,573+4최근 7일 스타 변화
- #25
Prompty를 사용하면 AI 애플리케이션을 위한 LLM 프롬프트를 쉽게 생성, 관리, 디버깅 및 평가할 수 있습니다. Prompty는 개발자를 위한 관측 가능성, 이해 가능성, 이식성을 향상시키도록 설계된 LLM 프롬프트 자산 클래스이자 포맷입니다.
★ 1,255+1최근 7일 스타 변화 - #26★ 1,194+1최근 7일 스타 변화
- #27
AI 에이전트를 위한 트레이스 네이티브 CI/CD — 프로덕션 장애가 PR을 차단하는 회귀 테스트가 됩니다. 자동 감지, 클러스터링, 격리된 케이스로 고정, CI에서 0달러로 재실행.
★ 1,176-22최근 7일 스타 변화 - #28★ 1,060+2최근 7일 스타 변화
- #29
안정적인 워크플로우, 근거 기반 RAG, 버전 관리 리포트, 자동 품질 평가 기능을 갖춘 AI 주식 리서치 에이전트.
★ 1,031-2최근 7일 스타 변화 - #30
AI 에이전트 구축 및 평가를 위한 최고의 리소스(논문, 블로그, 강연, 도구, 벤치마크)를 엄선한 실속 있는 라이브러리. BenchFlow에서 유지 관리합니다.
★ 865+17최근 7일 스타 변화