Saltar al contenido principal
buildradar
Sign in
Tema · evaluation

evaluation

Repositorios de código abierto monitorizados etiquetados con evaluation, ordenados por estrellas.

Repositorios
80
Estrellas totales
291.588
Estrellas de media
3645
Proporción
0,02%

Temas que aparecen con frecuencia junto a evaluation en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con evaluation.

  • fable-method@Sahir619

    El flujo de trabajo Fable: cómo funcionaba Claude Fable 5, destilado en habilidades que cualquier modelo puede ejecutar, con la evaluación que lo mantiene honesto. Pensar / actuar / demostrar.

    2267
  • Tracely-ai@Jwuthri

    CI/CD nativo de trazas para agentes de IA: los fallos en producción se convierten en pruebas de regresión que bloquean el PR. Detección automática, agrupación, congelación en casos herméticos y reproducción en CI a costo cero.

    1159
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 Plataforma de ingeniería de IA de código abierto: evaluaciones de LLM, observabilidad, métricas, gestión de prompts, playground, conjuntos de datos. Se integra con OpenTelemetry, LangChain, OpenAI SDK, LiteLLM y más. 🍊 YC W23

    33.909+372Variación de estrellas de los últimos 7 días
  • mlflow@mlflow

    La plataforma de ingeniería de IA de código abierto para agentes, LLMs y modelos de ML. MLflow permite a equipos de todos los tamaños depurar, evaluar, monitorear y optimizar aplicaciones de IA de calidad de producción mientras controlan los costos y gestionan el acceso a modelos y datos.

    27.728+114Variación de estrellas de los últimos 7 días
  • promptfoo@promptfoo

    Prueba tus prompts, agentes y RAGs. Pruebas de penetración, análisis de vulnerabilidades y red teaming para IA. Compara el rendimiento de GPT, Claude, Gemini, DeepSeek y más. Configuraciones declarativas simples con integración para línea de comandos y CI/CD. Utilizado por OpenAI y Anthropic.

    24.664+215Variación de estrellas de los últimos 7 días
  • opik@comet-ml

    Depura, evalúa y monitoriza tus aplicaciones de LLM, sistemas RAG y flujos de trabajo de agentes con seguimiento exhaustivo, evaluaciones automatizadas y paneles listos para producción.

    21.668+143Variación de estrellas de los últimos 7 días
  • WeKnora@Tencent

    Plataforma de conocimiento LLM de código abierto: transforma documentos sin procesar en un RAG consultable, un agente de razonamiento autónomo y una Wiki automantenible.

    20.899+581Variación de estrellas de los últimos 7 días
  • ragas@vibrantlabsai

    Potencia las evaluaciones de tus aplicaciones de LLM 🚀

    15.541+123Variación de estrellas de los últimos 7 días
  • oumi@oumi-ai

    ¡Ajusta, evalúa y despliega fácilmente Qwen, Gemma o cualquier LLM de pesos abiertos!

    9380+3Variación de estrellas de los últimos 7 días
  • opencompass@open-compass

    OpenCompass es una plataforma de evaluación de LLM, que admite una amplia gama de modelos (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, etc.) en más de 100 conjuntos de datos.

    7374+48Variación de estrellas de los últimos 7 días
  • helicone@Helicone

    🧊 Plataforma de observabilidad de LLM de código abierto. Una línea de código para monitorear, evaluar y experimentar. YC W23 🍓

    6116+23Variación de estrellas de los últimos 7 días
  • coze-loop@coze-dev

    Plataforma de optimización de agentes de IA de próxima generación: Cozeloop aborda los desafíos en el desarrollo de agentes de IA ofreciendo capacidades de gestión de ciclo de vida completo desde el desarrollo, depuración y evaluación hasta la supervisión.

    5706+7Variación de estrellas de los últimos 7 días
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: Ahora tu agente puede encontrar cualquier cosa en tu computadora. Se vuelve más inteligente si lo usas con frecuencia.

    5057+7Variación de estrellas de los últimos 7 días
  • Kiln@Kiln-AI

    Construye, evalúa y optimiza sistemas de IA. Incluye evaluaciones, RAG, agentes, ajuste fino, generación de datos sintéticos, gestión de conjuntos de datos, MCP y más.

    5037+7Variación de estrellas de los últimos 7 días
  • lmms-eval@EvolvingLMMs-Lab

    Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio

    4383+11Variación de estrellas de los últimos 7 días
  • VLMEvalKit@open-compass

    Kit de herramientas de evaluación de código abierto para grandes modelos multimodales (LMMs), compatible con más de 220 LMMs y más de 80 benchmarks

    4362+10Variación de estrellas de los últimos 7 días
  • evo@MichaelGrupp

    Paquete de Python para la evaluación de odometría y SLAM

    4310+7Variación de estrellas de los últimos 7 días
  • langwatch@langwatch

    La plataforma para evaluaciones de LLM y pruebas de agentes de IA

    3517+13Variación de estrellas de los últimos 7 días
  • mteb@embeddings-benchmark

    MTEB: Evaluación de vanguardia de incrustaciones en varios idiomas y modalidades.

    3409+9Variación de estrellas de los últimos 7 días
  • evalscope@modelscope

    Un marco de trabajo optimizado y personalizable para la evaluación eficiente y el análisis de rendimiento de modelos grandes (LLM, VLM, AIGC).

    3331+47Variación de estrellas de los últimos 7 días
  • SuperCLUE@CLUEbenchmark

    SuperCLUE: Benchmark integral de modelos de lenguaje grande en chino | Un benchmark para modelos fundamentales en chino

    3299-1Variación de estrellas de los últimos 7 días
  • lmnr@lmnr-ai

    Laminar: plataforma de observabilidad de código abierto diseñada específicamente para agentes de IA. YC S24.

    3210+24Variación de estrellas de los últimos 7 días
  • klipse@viebel

    Klipse es un plugin de JavaScript para incrustar fragmentos de código interactivos en blogs técnicos.

    3134+0Variación de estrellas de los últimos 7 días
  • ChainForge@ianarawjo

    Un entorno de programación visual de código abierto para realizar pruebas de estrés a los prompts de LLM.

    3028+1Variación de estrellas de los últimos 7 días
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes. Un sistema riguroso de ingeniería, evaluación, gobernanza y portabilidad para habilidades de agentes reutilizables.

    2557+160Variación de estrellas de los últimos 7 días
  • lighteval@huggingface

    Lighteval es tu caja de herramientas todo en uno para evaluar LLMs en múltiples backends

    2530+8Variación de estrellas de los últimos 7 días
  • evaluate@huggingface

    🤗 Evaluate: Una biblioteca para evaluar fácilmente modelos y conjuntos de datos de machine learning.

    2480+2Variación de estrellas de los últimos 7 días
  • uptrain@uptrain-ai

    UpTrain es una plataforma unificada de código abierto para evaluar y mejorar aplicaciones de IA generativa. Proporcionamos calificaciones para más de 20 comprobaciones preconfiguradas (que cubren casos de uso de lenguaje, código e incrustaciones), realizamos análisis de causa raíz en casos de falla y brindamos información sobre cómo resolverlos.

    2364+3Variación de estrellas de los últimos 7 días
  • graph-rag-agent@1517005260

    Integración de GraphRAG, LightRAG y Neo4j-llm-graph-builder para la construcción y búsqueda de grafos de conocimiento. Combinación de DeepSearch para el razonamiento RAG privado. Creación de un marco de evaluación personalizado para GraphRAG.

    2330+8Variación de estrellas de los últimos 7 días
  • fable-method@Sahir619

    El flujo de trabajo Fable: cómo funcionaba Claude Fable 5, destilado en habilidades que cualquier modelo puede ejecutar, con la evaluación que lo mantiene honesto. Pensar / actuar / demostrar.

    2267+23Variación de estrellas de los últimos 7 días
  • inspector@MCPJam

    Plataforma de pruebas y evaluación para chatear, inspeccionar y depurar servidores MCP, aplicaciones MCP y aplicaciones de ChatGPT.

    2177+23Variación de estrellas de los últimos 7 días
  • 📰 Artículos y blogs de lectura imprescindible sobre modelado de contexto largo basado en LLM 🔥

    2165+2Variación de estrellas de los últimos 7 días
← Volver a temas