Saltar al contenido principal
buildradar
Sign in
Tema · evaluation

evaluation

Repositorios de código abierto monitorizados etiquetados con evaluation, ordenados por estrellas.

80 repositorios
  • evaluation-guidebook@huggingface

    ¡Compartiendo conocimientos prácticos y teóricos sobre la evaluación de LLM que recopilamos mientras gestionábamos la Open LLM Leaderboard y diseñábamos lighteval!

    2143+2Variación de estrellas de los últimos 7 días
  • avalanche@ContinualAI

    Avalanche: una biblioteca de extremo a extremo para aprendizaje continuo basada en PyTorch.

    2088+0Variación de estrellas de los últimos 7 días
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Evaluando el estado del arte en IA

    2037-2Variación de estrellas de los últimos 7 días
  • alpaca_eval@tatsu-lab

    Un evaluador automático para modelos de lenguaje que siguen instrucciones. Validado por humanos, de alta calidad, económico y rápido.

    2012-1Variación de estrellas de los últimos 7 días
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) Implementación oficial en Python para "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics"

    1846+0Variación de estrellas de los últimos 7 días
  • WFGY@onestardao

    WFGY se encamina hacia WFGY 5.0 Polaris Protocol, un importante lanzamiento de código abierto para razonamiento de IA, RAG, agentes y flujos de trabajo del mundo real. Incluye Problem Map, Global Debug Card, WFGY 4.0 y el CFV Easter Egg.

    1786+1Variación de estrellas de los últimos 7 días
  • EmoLLM@SmartFlowAI

    Modelo de lenguaje grande (LLM) para salud mental, incluyendo pre y post-entrenamiento, conjuntos de datos, evaluación, despliegue y RAG, con modelos de las series InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama y GLM.

    1781+1Variación de estrellas de los últimos 7 días
  • trpc-agent-go@trpc-group

    Un framework de Go para construir sistemas de agentes en producción con flujos de trabajo de grafos, herramientas, memoria, A2A, AG-UI, MCP, evaluación y observabilidad.

    1760+12Variación de estrellas de los últimos 7 días
  • ragbits@deepsense-ai

    Componentes básicos para el desarrollo rápido de aplicaciones de IA generativa

    1668+0Variación de estrellas de los últimos 7 días
  • La página oficial de GitHub para el artículo de revisión "A Survey on Evaluation of Large Language Models".

    1608-1Variación de estrellas de los últimos 7 días
  • pycm@sepandhaghighi

    Biblioteca de matriz de confusión multiclase en Python.

    1506+0Variación de estrellas de los últimos 7 días
  • nlg-eval@Maluuba

    Código de evaluación para varias métricas automatizadas no supervisadas para la generación de lenguaje natural.

    1391+0Variación de estrellas de los últimos 7 días
  • lispy@abo-abo

    Edición de LISP breve y sencilla

    1300+0Variación de estrellas de los últimos 7 días
  • xai@EthicalML

    XAI - Una caja de herramientas de explicabilidad para aprendizaje automático

    1260+0Variación de estrellas de los últimos 7 días
  • intellagent@plurai-ai

    Un marco para el diagnóstico integral y la optimización de agentes mediante interacciones sintéticas simuladas y realistas

    1257+0Variación de estrellas de los últimos 7 días
  • KernelBench@ScalingIntelligence

    KernelBench: ¿Pueden los LLMs escribir kernels de GPU? - Benchmark + Kit de herramientas con Torch -> CUDA (+ más DSLs)

    1227+7Variación de estrellas de los últimos 7 días
  • kubetorch@run-house

    Distribuye y ejecuta cargas de trabajo de IA en Kubernetes de forma mágica con Python, similar a PyTorch para infraestructura de ML.

    1224+0Variación de estrellas de los últimos 7 días
  • fuzzbench@google

    FuzzBench: evaluación comparativa de fuzzers como servicio.

    1206+0Variación de estrellas de los últimos 7 días
  • torch-fidelity@toshas

    Métricas de rendimiento de alta fidelidad para modelos generativos en PyTorch

    1200+1Variación de estrellas de los últimos 7 días
  • Tracely-ai@Jwuthri

    CI/CD nativo de trazas para agentes de IA: los fallos en producción se convierten en pruebas de regresión que bloquean el PR. Detección automática, agrupación, congelación en casos herméticos y reproducción en CI a costo cero.

    1176-22Variación de estrellas de los últimos 7 días
  • ncalc@ncalc

    NCalc es una biblioteca de evaluación de expresiones rápida y ligera para .NET, diseñada para ofrecer flexibilidad y alto rendimiento. Soporta una amplia gama de operaciones matemáticas y lógicas.

    1156+2Variación de estrellas de los últimos 7 días
  • Gym@NVIDIA-NeMo

    Evalúe y mejore modelos y agentes utilizando entornos.

    1155+7Variación de estrellas de los últimos 7 días
  • prometheus-eval@prometheus-eval

    Evalúa la respuesta de tu LLM con Prometheus y GPT4 💯

    1111+4Variación de estrellas de los últimos 7 días
  • langsmith-sdk@langchain-ai

    Implementaciones del SDK de cliente para LangSmith

    1048+8Variación de estrellas de los últimos 7 días
  • API de SemanticKITTI para visualizar conjuntos de datos, procesar información y evaluar resultados.

    898+3Variación de estrellas de los últimos 7 días
  • deepfabric@nolabs-ai

    Generación de datos sintéticos de alta calidad, entrenamiento, medición y evaluación en un único pipeline

    885+3Variación de estrellas de los últimos 7 días
  • ClawProBench@suyoumo

    ClawProBench es un banco de pruebas orientado a la ejecución en tiempo real para evaluar agentes LLM en el entorno de ejecución OpenClaw, con calificación determinista y fiabilidad en pruebas repetidas.

    823+0Variación de estrellas de los últimos 7 días
  • OpenJudge@agentscope-ai

    OpenJudge: un marco unificado para la evaluación holística y recompensas de calidad.

    817+12Variación de estrellas de los últimos 7 días
  • gval@PaesslerAG

    Evaluación de expresiones en golang.

    814+1Variación de estrellas de los últimos 7 días
  • web-codegen-scorer@angular

    Web Codegen Scorer es una herramienta para evaluar la calidad del código web generado por LLMs

    775+4Variación de estrellas de los últimos 7 días
← Volver a temas