llm-evaluation
Repositorios de código abierto monitorizados etiquetados con llm-evaluation, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a llm-evaluation en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con llm-evaluation.
- #1
Una biblioteca curada y sin rodeos con los mejores recursos para construir y evaluar agentes de IA: artículos, blogs, charlas, herramientas y benchmarks. Mantenida por BenchFlow.
★ 864 - #2
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594 - #3
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
★ 352 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 Plataforma de ingeniería de IA de código abierto: evaluaciones de LLM, observabilidad, métricas, gestión de prompts, playground, conjuntos de datos. Se integra con OpenTelemetry, LangChain, OpenAI SDK, LiteLLM y más. 🍊 YC W23
★ 34.116+207Variación de estrellas de los últimos 7 días - #2
La plataforma de ingeniería de IA de código abierto para agentes, LLMs y modelos de ML. MLflow permite a equipos de todos los tamaños depurar, evaluar, monitorear y optimizar aplicaciones de IA de calidad de producción mientras controlan los costos y gestionan el acceso a modelos y datos.
★ 27.783+55Variación de estrellas de los últimos 7 días - #3
Prueba tus prompts, agentes y RAGs. Pruebas de penetración, análisis de vulnerabilidades y red teaming para IA. Compara el rendimiento de GPT, Claude, Gemini, DeepSeek y más. Configuraciones declarativas simples con integración para línea de comandos y CI/CD. Utilizado por OpenAI y Anthropic.
★ 24.767+103Variación de estrellas de los últimos 7 días - #4
Depura, evalúa y monitoriza tus aplicaciones de LLM, sistemas RAG y flujos de trabajo de agentes con seguimiento exhaustivo, evaluaciones automatizadas y paneles listos para producción.
★ 21.752+84Variación de estrellas de los últimos 7 días - #5★ 18.063+110Variación de estrellas de los últimos 7 días
- #6
Auditoría independiente de agentes de IA. Ejecutada por humanos o por el propio agente, para responder a la pregunta más crucial en la economía de los agentes de IA: ¿Está el agente haciendo lo que se supone que debe hacer? Con iFixAi puedes obtener esta respuesta en menos de 120 segundos.
★ 12.643+1247Variación de estrellas de los últimos 7 días - #7★ 11.298+55Variación de estrellas de los últimos 7 días
- #8★ 9094+23Variación de estrellas de los últimos 7 días
- #9
NoneLinear - ReLE es una evaluación de capacidades de modelos de lenguaje (LLM) en chino que incluye más de 374 modelos, desde opciones comerciales como ChatGPT, Claude y Ernie, hasta modelos de código abierto como DeepSeek, Llama y Mistral. Además de rankings, proporciona una base de datos de más de 2 millones de defectos de modelos para facilitar la investigación, el análisis y la mejora de la IA en la comunidad.
★ 6415+6Variación de estrellas de los últimos 7 días - #10
🧊 Plataforma de observabilidad de LLM de código abierto. Una línea de código para monitorear, evaluar y experimentar. YC W23 🍓
★ 6127+11Variación de estrellas de los últimos 7 días - #11
Una plataforma de Red Teaming de IA full-stack que asegura ecosistemas de IA mediante escaneo de agentes, habilidades, MCP, infraestructura de IA y evaluación de jailbreak de LLM.
★ 6117+59Variación de estrellas de los últimos 7 días - #12
🐢 Biblioteca de pruebas y evaluación de código abierto para agentes LLM
★ 5801+9Variación de estrellas de los últimos 7 días - #13
Agent OS: el agente se vuelve más inteligente por sí mismo. Nosotros mantenemos el estándar: el comando de calificación y el resultado esperado nunca forman parte del contrato de éxito que le entregamos. Evaluación por fases con acceso mediante entrevista, bucle de evolución con presupuesto. Servidor MCP, 13 entornos de ejecución: Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro y más.
★ 5753+25Variación de estrellas de los últimos 7 días - #14
La guía práctica de LLM: desde los fundamentos hasta el despliegue de aplicaciones avanzadas de LLM y RAG en AWS utilizando las mejores prácticas de LLMOps
★ 5310+8Variación de estrellas de los últimos 7 días - #15
AutoRAG: Ahora tu agente puede encontrar cualquier cosa en tu computadora. Se vuelve más inteligente si lo usas con frecuencia.
★ 5058+1Variación de estrellas de los últimos 7 días - #16
Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio
★ 4390+7Variación de estrellas de los últimos 7 días - #17
Una colección de métodos científicos, procesos, algoritmos y sistemas para construir historias y modelos.
★ 3676+2Variación de estrellas de los últimos 7 días - #18★ 3530+2Variación de estrellas de los últimos 7 días
- #19
Laminar: plataforma de observabilidad de código abierto diseñada específicamente para agentes de IA. YC S24.
★ 3219+9Variación de estrellas de los últimos 7 días - #20
Recursos completos sobre IA generativa, incluyendo una hoja de ruta detallada, proyectos, casos de uso, preparación para entrevistas y preparación de código.
★ 2610+1Variación de estrellas de los últimos 7 días - #21
Escáner de vulnerabilidades para LLM basado en agentes / kit de red teaming para IA.
★ 1983+3Variación de estrellas de los últimos 7 días - #22
Plataforma de código abierto de extremo a extremo para evaluar, observar y mejorar aplicaciones de LLM y agentes de IA. Incluye trazado, evaluaciones, simulaciones, conjuntos de datos, puerta de enlace y guardrails. Autohospedable. Licencia Apache 2.0.
★ 1909+42Variación de estrellas de los últimos 7 días - #23
Construye, enriquece y transforma conjuntos de datos utilizando modelos de IA sin necesidad de código.
★ 1641-1Variación de estrellas de los últimos 7 días - #24
Una herramienta potente para el fuzzing automatizado de LLM, diseñada para ayudar a desarrolladores e investigadores de seguridad a identificar y mitigar posibles jailbreaks en sus API de LLM.
★ 1573+4Variación de estrellas de los últimos 7 días - #25
Prompty facilita la creación, gestión, depuración y evaluación de prompts de LLM para aplicaciones de IA. Prompty es una clase de activo y formato para prompts de LLM diseñado para mejorar la observabilidad, comprensibilidad y portabilidad para los desarrolladores.
★ 1255+1Variación de estrellas de los últimos 7 días - #26
[JMLR 2026] "UQLM: Un paquete de Python para la cuantificación de la incertidumbre en modelos de lenguaje grandes"
★ 1194+1Variación de estrellas de los últimos 7 días - #27
CI/CD nativo de trazas para agentes de IA: los fallos en producción se convierten en pruebas de regresión que bloquean el PR. Detección automática, agrupación, congelación en casos herméticos y reproducción en CI a costo cero.
★ 1176-22Variación de estrellas de los últimos 7 días - #28
La pila de mejora continua para agentes. Nuestros datos de entorno y evaluaciones potencian la mejora y el monitoreo de agentes.
★ 1060+2Variación de estrellas de los últimos 7 días - #29
Agente de investigación de acciones con IA que cuenta con flujos de trabajo resilientes, RAG basado en evidencia, informes versionados y evaluación de calidad automatizada.
★ 1031-2Variación de estrellas de los últimos 7 días - #30
Una biblioteca curada y sin rodeos con los mejores recursos para construir y evaluar agentes de IA: artículos, blogs, charlas, herramientas y benchmarks. Mantenida por BenchFlow.
★ 864+17Variación de estrellas de los últimos 7 días