evaluation
evaluation 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 evaluation 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 evaluation 태그가 달린 리포지토리예요.
- #1
The Fable Workflow: Claude Fable 5의 작동 원리를 모든 모델이 실행할 수 있는 스킬로 추출하고, 무결성을 유지하는 평가 시스템을 포함합니다. 생각하기 / 행동하기 / 증명하기.
★ 2,267 - #2
AI 에이전트를 위한 트레이스 네이티브 CI/CD — 프로덕션 장애가 PR을 차단하는 회귀 테스트가 됩니다. 자동 감지, 클러스터링, 격리된 케이스로 고정, CI에서 0달러로 재실행.
★ 1,159 - #3
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
오픈소스 AI 엔지니어링 플랫폼: LLM 평가, 관측성, 지표, 프롬프트 관리, 플레이그라운드, 데이터셋. OpenTelemetry, LangChain, OpenAI SDK, LiteLLM 등과 통합. 🍊YC W23
★ 33,909+372최근 7일 스타 변화 - #2
에이전트, LLM 및 ML 모델을 위한 오픈 소스 AI 엔지니어링 플랫폼. MLflow를 통해 모든 규모의 팀이 비용을 제어하고 모델 및 데이터 접근을 관리하면서 프로덕션 수준의 AI 애플리케이션을 디버깅, 평가, 모니터링 및 최적화할 수 있습니다.
★ 27,728+114최근 7일 스타 변화 - #3
프롬프트, 에이전트 및 RAG 테스트. AI를 위한 레드 티밍/모의 해킹/취약점 스캐닝. GPT, Claude, Gemini, DeepSeek 등의 성능 비교. 명령줄 및 CI/CD 통합을 지원하는 간단한 선언형 설정. OpenAI 및 Anthropic에서 사용 중.
★ 24,664+215최근 7일 스타 변화 - #4
포괄적인 추적, 자동화된 평가, 프로덕션 준비가 완료된 대시보드를 통해 LLM 애플리케이션, RAG 시스템 및 에이전트 워크플로우를 디버깅, 평가 및 모니터링하세요.
★ 21,668+143최근 7일 스타 변화 - #5★ 20,899+581최근 7일 스타 변화
- #6★ 15,541+123최근 7일 스타 변화
- #7★ 9,380+3최근 7일 스타 변화
- #8
OpenCompass는 100개 이상의 데이터셋을 바탕으로 Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude 등 다양한 모델을 지원하는 LLM 평가 플랫폼입니다.
★ 7,374+48최근 7일 스타 변화 - #9★ 6,116+23최근 7일 스타 변화
- #10
차세대 AI Agent 최적화 플랫폼: Cozeloop은 개발, 디버깅, 평가부터 모니터링까지 전체 라이프사이클 관리 기능을 제공하여 AI agent 개발의 어려움을 해결합니다.
★ 5,706+7최근 7일 스타 변화 - #11★ 5,057+7최근 7일 스타 변화
- #12★ 5,037+7최근 7일 스타 변화
- #13★ 4,383+11최근 7일 스타 변화
- #14
대규모 멀티모달 모델(LMM)을 위한 오픈소스 평가 툴킷, 220개 이상의 LMM과 80개 이상의 벤치마크 지원
★ 4,362+10최근 7일 스타 변화 - #15★ 4,310+7최근 7일 스타 변화
- #16★ 3,517+13최근 7일 스타 변화
- #17★ 3,409+9최근 7일 스타 변화
- #18★ 3,331+47최근 7일 스타 변화
- #19★ 3,299-1최근 7일 스타 변화
- #20★ 3,210+24최근 7일 스타 변화
- #21★ 3,134+0최근 7일 스타 변화
- #22
LLM 프롬프트를 실전 테스트하기 위한 오픈 소스 시각적 프로그래밍 환경입니다.
★ 3,028+1최근 7일 스타 변화 - #23
YAO = Yielding AI Outcomes. 재사용 가능한 에이전트 스킬을 위한 엄격한 엔지니어링, 평가, 거버넌스 및 이식성 시스템입니다.
★ 2,557+160최근 7일 스타 변화 - #24★ 2,530+8최근 7일 스타 변화
- #25★ 2,480+2최근 7일 스타 변화
- #26
UpTrain은 생성형 AI 애플리케이션을 평가하고 개선하기 위한 오픈소스 통합 플랫폼입니다. 20개 이상의 사전 구성된 검사(언어, 코드, 임베디드 사용 사례 포함)에 대한 등급을 제공하고, 실패 사례에 대한 원인 분석을 수행하며, 이를 해결하는 방법에 대한 통찰력을 제공합니다.
★ 2,364+3최근 7일 스타 변화 - #27
RAG 구축: GraphRAG, LightRAG, Neo4j-llm-graph-builder를 통합하여 지식 그래프 구축 및 검색 수행; DeepSearch 기술을 통합하여 프라이빗 RAG 추론 구현; GraphRAG용 자체 평가 프레임워크 제작
★ 2,330+8최근 7일 스타 변화 - #28
The Fable Workflow: Claude Fable 5의 작동 원리를 모든 모델이 실행할 수 있는 스킬로 추출하고, 무결성을 유지하는 평가 시스템을 포함합니다. 생각하기 / 행동하기 / 증명하기.
★ 2,267+23최근 7일 스타 변화 - #29★ 2,177+23최근 7일 스타 변화
- #30
📰 LLM 기반 getLong Context Modeling 관련 필독 논문 및 블로그 모음 🔥
★ 2,165+2최근 7일 스타 변화