Pular para o conteúdo principal
buildradar
Sign in
Tópico · evals

evals

Repositórios de código aberto acompanhados marcados com evals, ordenados por estrelas.

Repositórios
22
Total de estrelas
86.828
Média de estrelas
3.947
Participação
0,00%

Tópicos que aparecem com frequência ao lado de evals no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com evals.

  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent é um framework de agente de IA local que você realmente possui, incluindo loop, memória e avaliação, tudo em código construído para permanecer legível à medida que cresce.

    1.649
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1.078
  • awesome-evals@benchflow-ai

    Uma biblioteca curada e direta dos melhores recursos para construir e avaliar agentes de IA — artigos, blogs, palestras, ferramentas e benchmarks. Mantida pela BenchFlow.

    865
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    612
  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    154
  • mastra@mastra-ai

    Mastra é o framework TypeScript moderno para aplicações e agentes movidos a IA.

    27.657+96Variação de estrelas nos últimos 7 dias
  • phoenix@Arize-ai

    Observabilidade e Avaliação de IA

    11.298+55Variação de estrelas nos últimos 7 dias
  • agentops@AgentOps-AI

    Python SDK para monitoramento de agentes de IA, rastreamento de custos de LLM, benchmarking e muito mais. Integra-se com a maioria das LLMs e frameworks de agentes, incluindo CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2 e CamelAI

    5.808+3Variação de estrelas nos últimos 7 dias
  • Kiln@Kiln-AI

    Construa, avalie e otimize sistemas de IA. Inclui avaliações, RAG, agentes, ajuste fino, geração de dados sintéticos, gerenciamento de conjuntos de dados, MCP e muito mais.

    5.042+5Variação de estrelas nos últimos 7 dias
  • harbor@harbor-framework

    Framework para avaliação e aprimoramento de agentes

    4.884+120Variação de estrelas nos últimos 7 dias
  • logfire@pydantic

    Plataforma de observabilidade de IA para sistemas de LLM e agentes em produção.

    4.450+4Variação de estrelas nos últimos 7 dias
  • trulens@truera

    Avaliação e rastreamento para experimentos de LLM e agentes de IA.

    3.530+2Variação de estrelas nos últimos 7 dias
  • lmnr@lmnr-ai

    Laminar - plataforma de observabilidade de código aberto criada especificamente para agentes de IA. YC S24.

    3.219+9Variação de estrelas nos últimos 7 dias
  • Guia de design de sistemas de IA para engenheiros que constroem sistemas de IA em produção e avaliações.

    2.978+59Variação de estrelas nos últimos 7 dias
  • agent-skills-platform@FrancyJGLisboa

    Transforme qualquer fluxo de trabalho em habilidades de agente de IA reutilizáveis que podem ser instaladas em 17 plataformas — Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro e mais. Um único SKILL.md para todas as plataformas.

    2.371+20Variação de estrelas nos últimos 7 dias
  • inspector@MCPJam

    Plataforma de teste e avaliação para conversar, inspecionar e depurar servidores MCP, aplicativos MCP e aplicativos ChatGPT.

    2.183+6Variação de estrelas nos últimos 7 dias
  • failproofai@FailproofAI

    Observabilidade e aplicação de políticas para harnesses de agentes de IA. Capture cada execução e a confiabilidade em tempo de execução com aplicação de políticas. 40 políticas integradas, um painel local, sem necessidade de conta e com um plano em nuvem gratuito generoso.

    1.719+203Variação de estrelas nos últimos 7 dias
  • evalite@mattpocock

    Avalie suas aplicações baseadas em LLM com TypeScript.

    1.673+3Variação de estrelas nos últimos 7 dias
  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent é um framework de agente de IA local que você realmente possui, incluindo loop, memória e avaliação, tudo em código construído para permanecer legível à medida que cresce.

    1.649+41Variação de estrelas nos últimos 7 dias
  • simba@GitHamza0206

    Atendimento ao cliente de código aberto pronto para produção com avaliações e monitoramento integrados

    1.539+1Variação de estrelas nos últimos 7 dias
  • raglite@superlinear-ai

    🥤 RAGLite é um kit de ferramentas Python para Geração Aumentada por Recuperação (RAG) com DuckDB ou PostgreSQL

    1.200+1Variação de estrelas nos últimos 7 dias
  • Tracely-ai@Jwuthri

    CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.

    1.176-22Variação de estrelas nos últimos 7 dias
  • heym@heymrun

    Construa sistemas de agentes. Execute-os com confiança. Orquestre agentes, automatize processos de negócios, inspecione cada execução e mantenha os humanos no controle. Implante o Heym em sua própria infraestrutura.

    1.113+55Variação de estrelas nos últimos 7 dias
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1.078+174Variação de estrelas nos últimos 7 dias
  • SkillForge@tripleyak

    Um criador de habilidades que comprova o funcionamento delas. Criação de habilidades orientada a evidências para Claude Code e Codex: geração testada por linha de base, avaliações de regressão por habilidade, médico de ecossistema, compilação em tempo de execução cruzada e um consultor proativo opcional.

    887+0Variação de estrelas nos últimos 7 dias
  • awesome-evals@benchflow-ai

    Uma biblioteca curada e direta dos melhores recursos para construir e avaliar agentes de IA — artigos, blogs, palestras, ferramentas e benchmarks. Mantida pela BenchFlow.

    865+17Variação de estrelas nos últimos 7 dias
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    612Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos