evals
evals 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 evals 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 evals 태그가 달린 리포지토리예요.
- #1
Waku Waku! Waku Agent는 루프, 메모리, 평가 등 코드로 작성되어 규모가 커져도 가독성이 유지되는, 실제로 소유할 수 있는 로컬 퍼스트 AI 에이전트 하네스입니다.
★ 1,649 - #2
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1,071 - #3
AI 에이전트 구축 및 평가를 위한 최고의 리소스(논문, 블로그, 강연, 도구, 벤치마크)를 엄선한 실속 있는 라이브러리. BenchFlow에서 유지 관리합니다.
★ 864 - #4
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 612 - #5★ 151
- #1★ 27,657+96최근 7일 스타 변화
- #2★ 11,298+55최근 7일 스타 변화
- #3
AI 에이전트 모니터링, LLM 비용 추적, 벤치마킹 등을 위한 Python SDK. CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, CamelAI를 비롯한 대부분의 LLM 및 에이전트 프레임워크와 통합됩니다.
★ 5,808+3최근 7일 스타 변화 - #4★ 5,042+5최근 7일 스타 변화
- #5★ 4,884+120최근 7일 스타 변화
- #6★ 4,450+4최근 7일 스타 변화
- #7★ 3,530+2최근 7일 스타 변화
- #8★ 3,219+9최근 7일 스타 변화
- #9
프로덕션 AI 시스템 및 평가(evals)를 구축하는 엔지니어를 위한 AI 시스템 설계 가이드
★ 2,978+59최근 7일 스타 변화 - #10
Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro 등 17개 플랫폼에 설치 가능한 재사용 가능한 AI 에이전트 스킬로 모든 워크플로우를 전환하세요. 하나의 SKILL.md로 모든 플랫폼에서 사용 가능합니다.
★ 2,371+20최근 7일 스타 변화 - #11★ 2,183+6최근 7일 스타 변화
- #12
AI 에이전트 하네스를 위한 관찰 가능성 및 정책 강제. 정책 적용을 통해 모든 실행과 런타임 신뢰성을 캡처합니다. 40개의 내장 정책, 로컬 대시보드 제공, 계정이 필요 없는 넉넉한 무료 클라우드 플랜.
★ 1,719+203최근 7일 스타 변화 - #13★ 1,673+3최근 7일 스타 변화
- #14
Waku Waku! Waku Agent는 루프, 메모리, 평가 등 코드로 작성되어 규모가 커져도 가독성이 유지되는, 실제로 소유할 수 있는 로컬 퍼스트 AI 에이전트 하네스입니다.
★ 1,649+41최근 7일 스타 변화 - #15★ 1,539+1최근 7일 스타 변화
- #16
🥤 RAGLite는 DuckDB 또는 PostgreSQL을 사용하는 RAG(Retrieval-Augmented Generation)용 Python 툴킷입니다.
★ 1,200+1최근 7일 스타 변화 - #17
AI 에이전트를 위한 트레이스 네이티브 CI/CD — 프로덕션 장애가 PR을 차단하는 회귀 테스트가 됩니다. 자동 감지, 클러스터링, 격리된 케이스로 고정, CI에서 0달러로 재실행.
★ 1,176-22최근 7일 스타 변화 - #18
에이전트 시스템을 구축하고 안정적으로 실행하세요. 에이전트를 오케스트레이션하고, 비즈니스 프로세스를 자동화하며, 모든 실행을 검사하고, 사람이 통제력을 유지할 수 있도록 합니다. 자체 인프라에 Heym을 배포하세요.
★ 1,105+55최근 7일 스타 변화 - #19
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1,071+174최근 7일 스타 변화 - #20
작동함을 증명하는 스킬 생성기. Claude Code와 Codex를 위한 증거 기반 스킬 생성: 기준선 테스트 생성, 스킬별 회귀 평가, 생태계 닥터, 크로스 런타임 컴파일 및 옵트인 사전 어드바이저.
★ 885+0최근 7일 스타 변화 - #21
AI 에이전트 구축 및 평가를 위한 최고의 리소스(논문, 블로그, 강연, 도구, 벤치마크)를 엄선한 실속 있는 라이브러리. BenchFlow에서 유지 관리합니다.
★ 864+17최근 7일 스타 변화 - #22
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 612—최근 7일 스타 변화