evals
Repositórios de código aberto acompanhados marcados com evals, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de evals no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com evals.
- #1
Waku Waku! Waku Agent é um framework de agente de IA local que você realmente possui, incluindo loop, memória e avaliação, tudo em código construído para permanecer legível à medida que cresce.
★ 1.649 - #2
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1.078 - #3
Uma biblioteca curada e direta dos melhores recursos para construir e avaliar agentes de IA — artigos, blogs, palestras, ferramentas e benchmarks. Mantida pela BenchFlow.
★ 865 - #4
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 612 - #5★ 154
- #1★ 27.657+96Variação de estrelas nos últimos 7 dias
- #2★ 11.298+55Variação de estrelas nos últimos 7 dias
- #3
Python SDK para monitoramento de agentes de IA, rastreamento de custos de LLM, benchmarking e muito mais. Integra-se com a maioria das LLMs e frameworks de agentes, incluindo CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2 e CamelAI
★ 5.808+3Variação de estrelas nos últimos 7 dias - #4
Construa, avalie e otimize sistemas de IA. Inclui avaliações, RAG, agentes, ajuste fino, geração de dados sintéticos, gerenciamento de conjuntos de dados, MCP e muito mais.
★ 5.042+5Variação de estrelas nos últimos 7 dias - #5★ 4.884+120Variação de estrelas nos últimos 7 dias
- #6★ 4.450+4Variação de estrelas nos últimos 7 dias
- #7★ 3.530+2Variação de estrelas nos últimos 7 dias
- #8
Laminar - plataforma de observabilidade de código aberto criada especificamente para agentes de IA. YC S24.
★ 3.219+9Variação de estrelas nos últimos 7 dias - #9
Guia de design de sistemas de IA para engenheiros que constroem sistemas de IA em produção e avaliações.
★ 2.978+59Variação de estrelas nos últimos 7 dias - #10
Transforme qualquer fluxo de trabalho em habilidades de agente de IA reutilizáveis que podem ser instaladas em 17 plataformas — Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro e mais. Um único SKILL.md para todas as plataformas.
★ 2.371+20Variação de estrelas nos últimos 7 dias - #11
Plataforma de teste e avaliação para conversar, inspecionar e depurar servidores MCP, aplicativos MCP e aplicativos ChatGPT.
★ 2.183+6Variação de estrelas nos últimos 7 dias - #12
Observabilidade e aplicação de políticas para harnesses de agentes de IA. Capture cada execução e a confiabilidade em tempo de execução com aplicação de políticas. 40 políticas integradas, um painel local, sem necessidade de conta e com um plano em nuvem gratuito generoso.
★ 1.719+203Variação de estrelas nos últimos 7 dias - #13★ 1.673+3Variação de estrelas nos últimos 7 dias
- #14
Waku Waku! Waku Agent é um framework de agente de IA local que você realmente possui, incluindo loop, memória e avaliação, tudo em código construído para permanecer legível à medida que cresce.
★ 1.649+41Variação de estrelas nos últimos 7 dias - #15
Atendimento ao cliente de código aberto pronto para produção com avaliações e monitoramento integrados
★ 1.539+1Variação de estrelas nos últimos 7 dias - #16
🥤 RAGLite é um kit de ferramentas Python para Geração Aumentada por Recuperação (RAG) com DuckDB ou PostgreSQL
★ 1.200+1Variação de estrelas nos últimos 7 dias - #17
CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.
★ 1.176-22Variação de estrelas nos últimos 7 dias - #18
Construa sistemas de agentes. Execute-os com confiança. Orquestre agentes, automatize processos de negócios, inspecione cada execução e mantenha os humanos no controle. Implante o Heym em sua própria infraestrutura.
★ 1.113+55Variação de estrelas nos últimos 7 dias - #19
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1.078+174Variação de estrelas nos últimos 7 dias - #20
Um criador de habilidades que comprova o funcionamento delas. Criação de habilidades orientada a evidências para Claude Code e Codex: geração testada por linha de base, avaliações de regressão por habilidade, médico de ecossistema, compilação em tempo de execução cruzada e um consultor proativo opcional.
★ 887+0Variação de estrelas nos últimos 7 dias - #21
Uma biblioteca curada e direta dos melhores recursos para construir e avaliar agentes de IA — artigos, blogs, palestras, ferramentas e benchmarks. Mantida pela BenchFlow.
★ 865+17Variação de estrelas nos últimos 7 dias - #22
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 612—Variação de estrelas nos últimos 7 dias