Saltar al contenido principal
buildradar
Sign in
Tema · llm-evaluation

llm-evaluation

Repositorios de código abierto monitorizados etiquetados con llm-evaluation, ordenados por estrellas.

Repositorios
37
Estrellas totales
234.912
Estrellas de media
6349
Proporción
0,01%

Temas que aparecen con frecuencia junto a llm-evaluation en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con llm-evaluation.

  • awesome-evals@benchflow-ai

    Una biblioteca curada y sin rodeos con los mejores recursos para construir y evaluar agentes de IA: artículos, blogs, charlas, herramientas y benchmarks. Mantenida por BenchFlow.

    864
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • KADATH@i3T4AN

    Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

    352
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 Plataforma de ingeniería de IA de código abierto: evaluaciones de LLM, observabilidad, métricas, gestión de prompts, playground, conjuntos de datos. Se integra con OpenTelemetry, LangChain, OpenAI SDK, LiteLLM y más. 🍊 YC W23

    34.116+207Variación de estrellas de los últimos 7 días
  • mlflow@mlflow

    La plataforma de ingeniería de IA de código abierto para agentes, LLMs y modelos de ML. MLflow permite a equipos de todos los tamaños depurar, evaluar, monitorear y optimizar aplicaciones de IA de calidad de producción mientras controlan los costos y gestionan el acceso a modelos y datos.

    27.783+55Variación de estrellas de los últimos 7 días
  • promptfoo@promptfoo

    Prueba tus prompts, agentes y RAGs. Pruebas de penetración, análisis de vulnerabilidades y red teaming para IA. Compara el rendimiento de GPT, Claude, Gemini, DeepSeek y más. Configuraciones declarativas simples con integración para línea de comandos y CI/CD. Utilizado por OpenAI y Anthropic.

    24.767+103Variación de estrellas de los últimos 7 días
  • opik@comet-ml

    Depura, evalúa y monitoriza tus aplicaciones de LLM, sistemas RAG y flujos de trabajo de agentes con seguimiento exhaustivo, evaluaciones automatizadas y paneles listos para producción.

    21.752+84Variación de estrellas de los últimos 7 días
  • deepeval@confident-ai

    El marco de evaluación para LLM

    18.063+110Variación de estrellas de los últimos 7 días
  • iFixAi@ifixai-ai

    Auditoría independiente de agentes de IA. Ejecutada por humanos o por el propio agente, para responder a la pregunta más crucial en la economía de los agentes de IA: ¿Está el agente haciendo lo que se supone que debe hacer? Con iFixAi puedes obtener esta respuesta en menos de 120 segundos.

    12.643+1247Variación de estrellas de los últimos 7 días
  • phoenix@Arize-ai

    Observabilidad y evaluación de IA

    11.298+55Variación de estrellas de los últimos 7 días
  • garak@NVIDIA

    el escáner de vulnerabilidades para LLM

    9094+23Variación de estrellas de los últimos 7 días
  • NoneLinear - ReLE es una evaluación de capacidades de modelos de lenguaje (LLM) en chino que incluye más de 374 modelos, desde opciones comerciales como ChatGPT, Claude y Ernie, hasta modelos de código abierto como DeepSeek, Llama y Mistral. Además de rankings, proporciona una base de datos de más de 2 millones de defectos de modelos para facilitar la investigación, el análisis y la mejora de la IA en la comunidad.

    6415+6Variación de estrellas de los últimos 7 días
  • helicone@Helicone

    🧊 Plataforma de observabilidad de LLM de código abierto. Una línea de código para monitorear, evaluar y experimentar. YC W23 🍓

    6127+11Variación de estrellas de los últimos 7 días
  • AI-Infra-Guard@Tencent

    Una plataforma de Red Teaming de IA full-stack que asegura ecosistemas de IA mediante escaneo de agentes, habilidades, MCP, infraestructura de IA y evaluación de jailbreak de LLM.

    6117+59Variación de estrellas de los últimos 7 días
  • giskard-oss@Giskard-AI

    🐢 Biblioteca de pruebas y evaluación de código abierto para agentes LLM

    5801+9Variación de estrellas de los últimos 7 días
  • ouroboros@Q00

    Agent OS: el agente se vuelve más inteligente por sí mismo. Nosotros mantenemos el estándar: el comando de calificación y el resultado esperado nunca forman parte del contrato de éxito que le entregamos. Evaluación por fases con acceso mediante entrevista, bucle de evolución con presupuesto. Servidor MCP, 13 entornos de ejecución: Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro y más.

    5753+25Variación de estrellas de los últimos 7 días
  • LLM-Engineers-Handbook@PacktPublishing

    La guía práctica de LLM: desde los fundamentos hasta el despliegue de aplicaciones avanzadas de LLM y RAG en AWS utilizando las mejores prácticas de LLMOps

    5310+8Variación de estrellas de los últimos 7 días
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: Ahora tu agente puede encontrar cualquier cosa en tu computadora. Se vuelve más inteligente si lo usas con frecuencia.

    5058+1Variación de estrellas de los últimos 7 días
  • lmms-eval@EvolvingLMMs-Lab

    Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio

    4390+7Variación de estrellas de los últimos 7 días
  • AI-Engineer-Headquarters@hemansnation

    Una colección de métodos científicos, procesos, algoritmos y sistemas para construir historias y modelos.

    3676+2Variación de estrellas de los últimos 7 días
  • trulens@truera

    Evaluación y seguimiento para experimentos de LLM y agentes de IA

    3530+2Variación de estrellas de los últimos 7 días
  • lmnr@lmnr-ai

    Laminar: plataforma de observabilidad de código abierto diseñada específicamente para agentes de IA. YC S24.

    3219+9Variación de estrellas de los últimos 7 días
  • generative-ai@genieincodebottle

    Recursos completos sobre IA generativa, incluyendo una hoja de ruta detallada, proyectos, casos de uso, preparación para entrevistas y preparación de código.

    2610+1Variación de estrellas de los últimos 7 días
  • agentic_security@msoedov

    Escáner de vulnerabilidades para LLM basado en agentes / kit de red teaming para IA.

    1983+3Variación de estrellas de los últimos 7 días
  • future-agi@future-agi

    Plataforma de código abierto de extremo a extremo para evaluar, observar y mejorar aplicaciones de LLM y agentes de IA. Incluye trazado, evaluaciones, simulaciones, conjuntos de datos, puerta de enlace y guardrails. Autohospedable. Licencia Apache 2.0.

    1909+42Variación de estrellas de los últimos 7 días
  • aisheets@huggingface

    Construye, enriquece y transforma conjuntos de datos utilizando modelos de IA sin necesidad de código.

    1641-1Variación de estrellas de los últimos 7 días
  • FuzzyAI@cyberark

    Una herramienta potente para el fuzzing automatizado de LLM, diseñada para ayudar a desarrolladores e investigadores de seguridad a identificar y mitigar posibles jailbreaks en sus API de LLM.

    1573+4Variación de estrellas de los últimos 7 días
  • prompty@microsoft

    Prompty facilita la creación, gestión, depuración y evaluación de prompts de LLM para aplicaciones de IA. Prompty es una clase de activo y formato para prompts de LLM diseñado para mejorar la observabilidad, comprensibilidad y portabilidad para los desarrolladores.

    1255+1Variación de estrellas de los últimos 7 días
  • uqlm@cvs-health

    [JMLR 2026] "UQLM: Un paquete de Python para la cuantificación de la incertidumbre en modelos de lenguaje grandes"

    1194+1Variación de estrellas de los últimos 7 días
  • Tracely-ai@Jwuthri

    CI/CD nativo de trazas para agentes de IA: los fallos en producción se convierten en pruebas de regresión que bloquean el PR. Detección automática, agrupación, congelación en casos herméticos y reproducción en CI a costo cero.

    1176-22Variación de estrellas de los últimos 7 días
  • judgeval@JudgmentLabs

    La pila de mejora continua para agentes. Nuestros datos de entorno y evaluaciones potencian la mejora y el monitoreo de agentes.

    1060+2Variación de estrellas de los últimos 7 días
  • FinSight-AI@juanjuandog

    Agente de investigación de acciones con IA que cuenta con flujos de trabajo resilientes, RAG basado en evidencia, informes versionados y evaluación de calidad automatizada.

    1031-2Variación de estrellas de los últimos 7 días
  • awesome-evals@benchflow-ai

    Una biblioteca curada y sin rodeos con los mejores recursos para construir y evaluar agentes de IA: artículos, blogs, charlas, herramientas y benchmarks. Mantenida por BenchFlow.

    864+17Variación de estrellas de los últimos 7 días
← Volver a temas