Saltar al contenido principal
buildradar
Sign in
Tema · evals

evals

Repositorios de código abierto monitorizados etiquetados con evals, ordenados por estrellas.

Repositorios
22
Estrellas totales
86.828
Estrellas de media
3947
Proporción
0,00%

Temas que aparecen con frecuencia junto a evals en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con evals.

  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent es un entorno de agentes de IA local-first que realmente posees, incluyendo bucles, memoria y evaluación, todo en un código diseñado para mantenerse legible a medida que crece.

    1649
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1071
  • awesome-evals@benchflow-ai

    Una biblioteca curada y sin rodeos con los mejores recursos para construir y evaluar agentes de IA: artículos, blogs, charlas, herramientas y benchmarks. Mantenida por BenchFlow.

    864
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    607
  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    151
  • mastra@mastra-ai

    Mastra es el framework moderno de TypeScript para aplicaciones y agentes impulsados por IA.

    27.657+96Variación de estrellas de los últimos 7 días
  • phoenix@Arize-ai

    Observabilidad y evaluación de IA

    11.298+55Variación de estrellas de los últimos 7 días
  • agentops@AgentOps-AI

    SDK de Python para la monitorización de agentes de IA, seguimiento de costes de LLM, pruebas comparativas y más. Se integra con la mayoría de LLMs y frameworks de agentes, incluidos CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2 y CamelAI.

    5808+3Variación de estrellas de los últimos 7 días
  • Kiln@Kiln-AI

    Construye, evalúa y optimiza sistemas de IA. Incluye evaluaciones, RAG, agentes, ajuste fino, generación de datos sintéticos, gestión de conjuntos de datos, MCP y más.

    5042+5Variación de estrellas de los últimos 7 días
  • harbor@harbor-framework

    Framework para evaluar y mejorar agentes

    4884+120Variación de estrellas de los últimos 7 días
  • logfire@pydantic

    Plataforma de observabilidad de IA para sistemas LLM y de agentes en producción.

    4450+4Variación de estrellas de los últimos 7 días
  • trulens@truera

    Evaluación y seguimiento para experimentos de LLM y agentes de IA

    3530+2Variación de estrellas de los últimos 7 días
  • lmnr@lmnr-ai

    Laminar: plataforma de observabilidad de código abierto diseñada específicamente para agentes de IA. YC S24.

    3219+9Variación de estrellas de los últimos 7 días
  • Guía de diseño de sistemas de IA para ingenieros que construyen sistemas de IA de producción y evaluaciones.

    2978+59Variación de estrellas de los últimos 7 días
  • agent-skills-platform@FrancyJGLisboa

    Convierte cualquier flujo de trabajo en habilidades de agente de IA reutilizables que se instalan en 17 plataformas: Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro y más. Un solo SKILL.md para todas las plataformas.

    2371+20Variación de estrellas de los últimos 7 días
  • inspector@MCPJam

    Plataforma de pruebas y evaluación para chatear, inspeccionar y depurar servidores MCP, aplicaciones MCP y aplicaciones de ChatGPT.

    2183+6Variación de estrellas de los últimos 7 días
  • failproofai@FailproofAI

    Observabilidad y cumplimiento para entornos de agentes de IA. Captura cada ejecución y la fiabilidad en tiempo de ejecución con políticas de cumplimiento. Incluye 40 políticas integradas, un panel local y no requiere cuenta, con un generoso plan gratuito en la nube.

    1719+203Variación de estrellas de los últimos 7 días
  • evalite@mattpocock

    Evalúa tus aplicaciones basadas en LLM con TypeScript.

    1673+3Variación de estrellas de los últimos 7 días
  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent es un entorno de agentes de IA local-first que realmente posees, incluyendo bucles, memoria y evaluación, todo en un código diseñado para mantenerse legible a medida que crece.

    1649+41Variación de estrellas de los últimos 7 días
  • simba@GitHamza0206

    Servicio al cliente de código abierto listo para producción con Evals y monitoreo incorporados

    1539+1Variación de estrellas de los últimos 7 días
  • raglite@superlinear-ai

    🥤 RAGLite es un kit de herramientas de Python para generación aumentada por recuperación (RAG) con DuckDB o PostgreSQL

    1200+1Variación de estrellas de los últimos 7 días
  • Tracely-ai@Jwuthri

    CI/CD nativo de trazas para agentes de IA: los fallos en producción se convierten en pruebas de regresión que bloquean el PR. Detección automática, agrupación, congelación en casos herméticos y reproducción en CI a costo cero.

    1176-22Variación de estrellas de los últimos 7 días
  • heym@heymrun

    Construye sistemas de agentes. Ejecútalos con confianza. Orquesta agentes, automatiza procesos de negocio, inspecciona cada ejecución y mantén el control humano. Despliega Heym en tu propia infraestructura.

    1105+55Variación de estrellas de los últimos 7 días
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1071+174Variación de estrellas de los últimos 7 días
  • SkillForge@tripleyak

    Un creador de habilidades que verifica su funcionamiento. Creación de habilidades basada en evidencia para Claude Code y Codex: generación probada, evaluaciones de regresión por habilidad, diagnóstico del ecosistema, compilación multiplataforma y asesor proactivo opcional.

    885+0Variación de estrellas de los últimos 7 días
  • awesome-evals@benchflow-ai

    Una biblioteca curada y sin rodeos con los mejores recursos para construir y evaluar agentes de IA: artículos, blogs, charlas, herramientas y benchmarks. Mantenida por BenchFlow.

    864+17Variación de estrellas de los últimos 7 días
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    607Variación de estrellas de los últimos 7 días
← Volver a temas