evaluation-framework
Repositorios de código abierto monitorizados etiquetados con evaluation-framework, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a evaluation-framework en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con evaluation-framework.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Prueba tus prompts, agentes y RAGs. Pruebas de penetración, análisis de vulnerabilidades y red teaming para IA. Compara el rendimiento de GPT, Claude, Gemini, DeepSeek y más. Configuraciones declarativas simples con integración para línea de comandos y CI/CD. Utilizado por OpenAI y Anthropic.
★ 24.664+215Variación de estrellas de los últimos 7 días - #2★ 17.953+184Variación de estrellas de los últimos 7 días
- #3
Un framework para la evaluación de pocos ejemplos (few-shot) de modelos de lenguaje.
★ 13.827+89Variación de estrellas de los últimos 7 días - #4
Construye, evalúa y optimiza sistemas de IA. Incluye evaluaciones, RAG, agentes, ajuste fino, generación de datos sintéticos, gestión de conjuntos de datos, MCP y más.
★ 5037+7Variación de estrellas de los últimos 7 días - #5
Lighteval es tu caja de herramientas todo en uno para evaluar LLMs en múltiples backends
★ 2530+8Variación de estrellas de los últimos 7 días - #6
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Evaluando el estado del arte en IA
★ 2037-2Variación de estrellas de los últimos 7 días - #7
Plataforma de código abierto de extremo a extremo para evaluar, observar y mejorar aplicaciones de LLM y agentes de IA. Incluye trazado, evaluaciones, simulaciones, conjuntos de datos, puerta de enlace y guardrails. Autohospedable. Licencia Apache 2.0.
★ 1873+89Variación de estrellas de los últimos 7 días - #8
Repositorio para la guía definitiva de agentes de IA
★ 1386+422Variación de estrellas de los últimos 7 días - #9
AgentLab: un framework de código abierto para desarrollar, probar y evaluar agentes web en diversas tareas, diseñado para la escalabilidad y la reproducibilidad.
★ 627+2Variación de estrellas de los últimos 7 días - #10
Evaluación basada en datos para aplicaciones impulsadas por LLM.
★ 517+1Variación de estrellas de los últimos 7 días