본문으로 건너뛰기
buildradar
Sign in
토픽 · evals

evals

evals 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
22
총 스타
86,828
평균 스타
3,947
비중
0.00%

같은 리포지토리에 evals 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 evals 태그가 달린 리포지토리예요.

  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent는 루프, 메모리, 평가 등 코드로 작성되어 규모가 커져도 가독성이 유지되는, 실제로 소유할 수 있는 로컬 퍼스트 AI 에이전트 하네스입니다.

    1,649
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1,071
  • awesome-evals@benchflow-ai

    AI 에이전트 구축 및 평가를 위한 최고의 리소스(논문, 블로그, 강연, 도구, 벤치마크)를 엄선한 실속 있는 라이브러리. BenchFlow에서 유지 관리합니다.

    864
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    612
  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    151
  • mastra@mastra-ai

    Mastra는 AI 기반 애플리케이션과 에이전트를 위한 모던 TypeScript 프레임워크입니다.

    27,657+96최근 7일 스타 변화
  • phoenix@Arize-ai

    AI 관측 가능성 및 평가

    11,298+55최근 7일 스타 변화
  • agentops@AgentOps-AI

    AI 에이전트 모니터링, LLM 비용 추적, 벤치마킹 등을 위한 Python SDK. CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, CamelAI를 비롯한 대부분의 LLM 및 에이전트 프레임워크와 통합됩니다.

    5,808+3최근 7일 스타 변화
  • Kiln@Kiln-AI

    AI 시스템 구축, 평가 및 최적화. 평가, RAG, 에이전트, 파인튜닝, 합성 데이터 생성, 데이터셋 관리, MCP 등을 포함합니다.

    5,042+5최근 7일 스타 변화
  • harbor@harbor-framework

    에이전트 평가 및 개선을 위한 프레임워크

    4,884+120최근 7일 스타 변화
  • logfire@pydantic

    프로덕션 LLM 및 에이전트 시스템을 위한 AI 관측 가능성 플랫폼

    4,450+4최근 7일 스타 변화
  • trulens@truera

    LLM 실험 및 AI 에이전트를 위한 평가 및 추적

    3,530+2최근 7일 스타 변화
  • lmnr@lmnr-ai

    Laminar - AI 에이전트 전용으로 구축된 오픈 소스 관측 가능성 플랫폼. YC S24.

    3,219+9최근 7일 스타 변화
  • 프로덕션 AI 시스템 및 평가(evals)를 구축하는 엔지니어를 위한 AI 시스템 설계 가이드

    2,978+59최근 7일 스타 변화
  • agent-skills-platform@FrancyJGLisboa

    Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro 등 17개 플랫폼에 설치 가능한 재사용 가능한 AI 에이전트 스킬로 모든 워크플로우를 전환하세요. 하나의 SKILL.md로 모든 플랫폼에서 사용 가능합니다.

    2,371+20최근 7일 스타 변화
  • inspector@MCPJam

    MCP 서버, MCP 앱 및 ChatGPT 앱을 채팅, 검사, 디버깅하기 위한 테스트 및 평가 플랫폼.

    2,183+6최근 7일 스타 변화
  • failproofai@FailproofAI

    AI 에이전트 하네스를 위한 관찰 가능성 및 정책 강제. 정책 적용을 통해 모든 실행과 런타임 신뢰성을 캡처합니다. 40개의 내장 정책, 로컬 대시보드 제공, 계정이 필요 없는 넉넉한 무료 클라우드 플랜.

    1,719+203최근 7일 스타 변화
  • evalite@mattpocock

    TypeScript로 LLM 기반 앱 평가하기

    1,673+3최근 7일 스타 변화
  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent는 루프, 메모리, 평가 등 코드로 작성되어 규모가 커져도 가독성이 유지되는, 실제로 소유할 수 있는 로컬 퍼스트 AI 에이전트 하네스입니다.

    1,649+41최근 7일 스타 변화
  • simba@GitHamza0206

    평가(Evals) 및 모니터링이 내장된 오픈소스 프로덕션 준비 완료 고객 서비스

    1,539+1최근 7일 스타 변화
  • raglite@superlinear-ai

    🥤 RAGLite는 DuckDB 또는 PostgreSQL을 사용하는 RAG(Retrieval-Augmented Generation)용 Python 툴킷입니다.

    1,200+1최근 7일 스타 변화
  • Tracely-ai@Jwuthri

    AI 에이전트를 위한 트레이스 네이티브 CI/CD — 프로덕션 장애가 PR을 차단하는 회귀 테스트가 됩니다. 자동 감지, 클러스터링, 격리된 케이스로 고정, CI에서 0달러로 재실행.

    1,176-22최근 7일 스타 변화
  • heym@heymrun

    에이전트 시스템을 구축하고 안정적으로 실행하세요. 에이전트를 오케스트레이션하고, 비즈니스 프로세스를 자동화하며, 모든 실행을 검사하고, 사람이 통제력을 유지할 수 있도록 합니다. 자체 인프라에 Heym을 배포하세요.

    1,105+55최근 7일 스타 변화
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1,071+174최근 7일 스타 변화
  • SkillForge@tripleyak

    작동함을 증명하는 스킬 생성기. Claude Code와 Codex를 위한 증거 기반 스킬 생성: 기준선 테스트 생성, 스킬별 회귀 평가, 생태계 닥터, 크로스 런타임 컴파일 및 옵트인 사전 어드바이저.

    885+0최근 7일 스타 변화
  • awesome-evals@benchflow-ai

    AI 에이전트 구축 및 평가를 위한 최고의 리소스(논문, 블로그, 강연, 도구, 벤치마크)를 엄선한 실속 있는 라이브러리. BenchFlow에서 유지 관리합니다.

    864+17최근 7일 스타 변화
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    612최근 7일 스타 변화
← 토픽 목록으로