evaluation
Repositorios de código abierto monitorizados etiquetados con evaluation, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a evaluation en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con evaluation.
- #1
El flujo de trabajo Fable: cómo funcionaba Claude Fable 5, destilado en habilidades que cualquier modelo puede ejecutar, con la evaluación que lo mantiene honesto. Pensar / actuar / demostrar.
★ 2267 - #2
CI/CD nativo de trazas para agentes de IA: los fallos en producción se convierten en pruebas de regresión que bloquean el PR. Detección automática, agrupación, congelación en casos herméticos y reproducción en CI a costo cero.
★ 1159 - #3
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 Plataforma de ingeniería de IA de código abierto: evaluaciones de LLM, observabilidad, métricas, gestión de prompts, playground, conjuntos de datos. Se integra con OpenTelemetry, LangChain, OpenAI SDK, LiteLLM y más. 🍊 YC W23
★ 33.909+372Variación de estrellas de los últimos 7 días - #2
La plataforma de ingeniería de IA de código abierto para agentes, LLMs y modelos de ML. MLflow permite a equipos de todos los tamaños depurar, evaluar, monitorear y optimizar aplicaciones de IA de calidad de producción mientras controlan los costos y gestionan el acceso a modelos y datos.
★ 27.728+114Variación de estrellas de los últimos 7 días - #3
Prueba tus prompts, agentes y RAGs. Pruebas de penetración, análisis de vulnerabilidades y red teaming para IA. Compara el rendimiento de GPT, Claude, Gemini, DeepSeek y más. Configuraciones declarativas simples con integración para línea de comandos y CI/CD. Utilizado por OpenAI y Anthropic.
★ 24.664+215Variación de estrellas de los últimos 7 días - #4
Depura, evalúa y monitoriza tus aplicaciones de LLM, sistemas RAG y flujos de trabajo de agentes con seguimiento exhaustivo, evaluaciones automatizadas y paneles listos para producción.
★ 21.668+143Variación de estrellas de los últimos 7 días - #5
Plataforma de conocimiento LLM de código abierto: transforma documentos sin procesar en un RAG consultable, un agente de razonamiento autónomo y una Wiki automantenible.
★ 20.899+581Variación de estrellas de los últimos 7 días - #6★ 15.541+123Variación de estrellas de los últimos 7 días
- #7★ 9380+3Variación de estrellas de los últimos 7 días
- #8
OpenCompass es una plataforma de evaluación de LLM, que admite una amplia gama de modelos (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, etc.) en más de 100 conjuntos de datos.
★ 7374+48Variación de estrellas de los últimos 7 días - #9
🧊 Plataforma de observabilidad de LLM de código abierto. Una línea de código para monitorear, evaluar y experimentar. YC W23 🍓
★ 6116+23Variación de estrellas de los últimos 7 días - #10
Plataforma de optimización de agentes de IA de próxima generación: Cozeloop aborda los desafíos en el desarrollo de agentes de IA ofreciendo capacidades de gestión de ciclo de vida completo desde el desarrollo, depuración y evaluación hasta la supervisión.
★ 5706+7Variación de estrellas de los últimos 7 días - #11
AutoRAG: Ahora tu agente puede encontrar cualquier cosa en tu computadora. Se vuelve más inteligente si lo usas con frecuencia.
★ 5057+7Variación de estrellas de los últimos 7 días - #12
Construye, evalúa y optimiza sistemas de IA. Incluye evaluaciones, RAG, agentes, ajuste fino, generación de datos sintéticos, gestión de conjuntos de datos, MCP y más.
★ 5037+7Variación de estrellas de los últimos 7 días - #13
Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio
★ 4383+11Variación de estrellas de los últimos 7 días - #14
Kit de herramientas de evaluación de código abierto para grandes modelos multimodales (LMMs), compatible con más de 220 LMMs y más de 80 benchmarks
★ 4362+10Variación de estrellas de los últimos 7 días - #15★ 4310+7Variación de estrellas de los últimos 7 días
- #16★ 3517+13Variación de estrellas de los últimos 7 días
- #17
MTEB: Evaluación de vanguardia de incrustaciones en varios idiomas y modalidades.
★ 3409+9Variación de estrellas de los últimos 7 días - #18
Un marco de trabajo optimizado y personalizable para la evaluación eficiente y el análisis de rendimiento de modelos grandes (LLM, VLM, AIGC).
★ 3331+47Variación de estrellas de los últimos 7 días - #19
SuperCLUE: Benchmark integral de modelos de lenguaje grande en chino | Un benchmark para modelos fundamentales en chino
★ 3299-1Variación de estrellas de los últimos 7 días - #20
Laminar: plataforma de observabilidad de código abierto diseñada específicamente para agentes de IA. YC S24.
★ 3210+24Variación de estrellas de los últimos 7 días - #21
Klipse es un plugin de JavaScript para incrustar fragmentos de código interactivos en blogs técnicos.
★ 3134+0Variación de estrellas de los últimos 7 días - #22
Un entorno de programación visual de código abierto para realizar pruebas de estrés a los prompts de LLM.
★ 3028+1Variación de estrellas de los últimos 7 días - #23
YAO = Yielding AI Outcomes. Un sistema riguroso de ingeniería, evaluación, gobernanza y portabilidad para habilidades de agentes reutilizables.
★ 2557+160Variación de estrellas de los últimos 7 días - #24
Lighteval es tu caja de herramientas todo en uno para evaluar LLMs en múltiples backends
★ 2530+8Variación de estrellas de los últimos 7 días - #25
🤗 Evaluate: Una biblioteca para evaluar fácilmente modelos y conjuntos de datos de machine learning.
★ 2480+2Variación de estrellas de los últimos 7 días - #26
UpTrain es una plataforma unificada de código abierto para evaluar y mejorar aplicaciones de IA generativa. Proporcionamos calificaciones para más de 20 comprobaciones preconfiguradas (que cubren casos de uso de lenguaje, código e incrustaciones), realizamos análisis de causa raíz en casos de falla y brindamos información sobre cómo resolverlos.
★ 2364+3Variación de estrellas de los últimos 7 días - #27
Integración de GraphRAG, LightRAG y Neo4j-llm-graph-builder para la construcción y búsqueda de grafos de conocimiento. Combinación de DeepSearch para el razonamiento RAG privado. Creación de un marco de evaluación personalizado para GraphRAG.
★ 2330+8Variación de estrellas de los últimos 7 días - #28
El flujo de trabajo Fable: cómo funcionaba Claude Fable 5, destilado en habilidades que cualquier modelo puede ejecutar, con la evaluación que lo mantiene honesto. Pensar / actuar / demostrar.
★ 2267+23Variación de estrellas de los últimos 7 días - #29
Plataforma de pruebas y evaluación para chatear, inspeccionar y depurar servidores MCP, aplicaciones MCP y aplicaciones de ChatGPT.
★ 2177+23Variación de estrellas de los últimos 7 días - #30
📰 Artículos y blogs de lectura imprescindible sobre modelado de contexto largo basado en LLM 🔥
★ 2165+2Variación de estrellas de los últimos 7 días