evals
Repositorios de código abierto monitorizados etiquetados con evals, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a evals en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con evals.
- #1
Waku Waku! Waku Agent es un entorno de agentes de IA local-first que realmente posees, incluyendo bucles, memoria y evaluación, todo en un código diseñado para mantenerse legible a medida que crece.
★ 1649 - #2
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1071 - #3
Una biblioteca curada y sin rodeos con los mejores recursos para construir y evaluar agentes de IA: artículos, blogs, charlas, herramientas y benchmarks. Mantenida por BenchFlow.
★ 864 - #4
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 607 - #5★ 151
- #1
Mastra es el framework moderno de TypeScript para aplicaciones y agentes impulsados por IA.
★ 27.657+96Variación de estrellas de los últimos 7 días - #2★ 11.298+55Variación de estrellas de los últimos 7 días
- #3
SDK de Python para la monitorización de agentes de IA, seguimiento de costes de LLM, pruebas comparativas y más. Se integra con la mayoría de LLMs y frameworks de agentes, incluidos CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2 y CamelAI.
★ 5808+3Variación de estrellas de los últimos 7 días - #4
Construye, evalúa y optimiza sistemas de IA. Incluye evaluaciones, RAG, agentes, ajuste fino, generación de datos sintéticos, gestión de conjuntos de datos, MCP y más.
★ 5042+5Variación de estrellas de los últimos 7 días - #5★ 4884+120Variación de estrellas de los últimos 7 días
- #6★ 4450+4Variación de estrellas de los últimos 7 días
- #7★ 3530+2Variación de estrellas de los últimos 7 días
- #8
Laminar: plataforma de observabilidad de código abierto diseñada específicamente para agentes de IA. YC S24.
★ 3219+9Variación de estrellas de los últimos 7 días - #9
Guía de diseño de sistemas de IA para ingenieros que construyen sistemas de IA de producción y evaluaciones.
★ 2978+59Variación de estrellas de los últimos 7 días - #10
Convierte cualquier flujo de trabajo en habilidades de agente de IA reutilizables que se instalan en 17 plataformas: Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro y más. Un solo SKILL.md para todas las plataformas.
★ 2371+20Variación de estrellas de los últimos 7 días - #11
Plataforma de pruebas y evaluación para chatear, inspeccionar y depurar servidores MCP, aplicaciones MCP y aplicaciones de ChatGPT.
★ 2183+6Variación de estrellas de los últimos 7 días - #12
Observabilidad y cumplimiento para entornos de agentes de IA. Captura cada ejecución y la fiabilidad en tiempo de ejecución con políticas de cumplimiento. Incluye 40 políticas integradas, un panel local y no requiere cuenta, con un generoso plan gratuito en la nube.
★ 1719+203Variación de estrellas de los últimos 7 días - #13★ 1673+3Variación de estrellas de los últimos 7 días
- #14
Waku Waku! Waku Agent es un entorno de agentes de IA local-first que realmente posees, incluyendo bucles, memoria y evaluación, todo en un código diseñado para mantenerse legible a medida que crece.
★ 1649+41Variación de estrellas de los últimos 7 días - #15
Servicio al cliente de código abierto listo para producción con Evals y monitoreo incorporados
★ 1539+1Variación de estrellas de los últimos 7 días - #16
🥤 RAGLite es un kit de herramientas de Python para generación aumentada por recuperación (RAG) con DuckDB o PostgreSQL
★ 1200+1Variación de estrellas de los últimos 7 días - #17
CI/CD nativo de trazas para agentes de IA: los fallos en producción se convierten en pruebas de regresión que bloquean el PR. Detección automática, agrupación, congelación en casos herméticos y reproducción en CI a costo cero.
★ 1176-22Variación de estrellas de los últimos 7 días - #18
Construye sistemas de agentes. Ejecútalos con confianza. Orquesta agentes, automatiza procesos de negocio, inspecciona cada ejecución y mantén el control humano. Despliega Heym en tu propia infraestructura.
★ 1105+55Variación de estrellas de los últimos 7 días - #19
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1071+174Variación de estrellas de los últimos 7 días - #20
Un creador de habilidades que verifica su funcionamiento. Creación de habilidades basada en evidencia para Claude Code y Codex: generación probada, evaluaciones de regresión por habilidad, diagnóstico del ecosistema, compilación multiplataforma y asesor proactivo opcional.
★ 885+0Variación de estrellas de los últimos 7 días - #21
Una biblioteca curada y sin rodeos con los mejores recursos para construir y evaluar agentes de IA: artículos, blogs, charlas, herramientas y benchmarks. Mantenida por BenchFlow.
★ 864+17Variación de estrellas de los últimos 7 días - #22
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 607—Variación de estrellas de los últimos 7 días