evaluation
Repositorios de código abierto monitorizados etiquetados con evaluation, ordenados por estrellas.
- #61★ 768+0Variación de estrellas de los últimos 7 días
- #62
[EMNLP 2024 & AAAI 2026] Un potente kit de herramientas para comprimir modelos grandes, incluyendo LLMs, VLMs y modelos generativos de video.
★ 747+4Variación de estrellas de los últimos 7 días - #63
Plugin oficial para OpenClaw que exporta trazas de agentes a Opik. Visualiza y monitorea el comportamiento del agente, costos, tokens, errores y más.
★ 725+0Variación de estrellas de los últimos 7 días - #64
Implementación en Python del rastreador IOU
★ 702+0Variación de estrellas de los últimos 7 días - #65
⚡️ Una biblioteca de Python ultrarrápida para evaluación, comparación y fusión de rankings 🐍
★ 698+4Variación de estrellas de los últimos 7 días - #66
Evaluación comparativa de la veracidad en textos largos para modelos de lenguaje extensos. Código original para nuestro artículo "Long-form factuality in large language models".
★ 693+2Variación de estrellas de los últimos 7 días - #67
Benchmark de código abierto para agentes de IA en navegadores para tareas diarias.
★ 675+61Variación de estrellas de los últimos 7 días - #68
Awesome-LLM-Eval: una lista curada de herramientas, conjuntos de datos/benchmarks, demos, tablas de clasificación, artículos, documentación y modelos, enfocada principalmente en la evaluación de LLMs.
★ 656-2Variación de estrellas de los últimos 7 días - #69
AutoPrompt: Construcción automática de prompts para modelos de lenguaje enmascarados.
★ 641+0Variación de estrellas de los últimos 7 días - #70★ 632+2Variación de estrellas de los últimos 7 días
- #71
Un evaluador simple de expresiones matemáticas y pseudo C# en un solo archivo C#. También puede ejecutar pequeños scripts similares a C#
★ 630+0Variación de estrellas de los últimos 7 días - #72
Repositorio de recursos sobre machine unlearning en modelos de lenguaje de gran tamaño
★ 624+0Variación de estrellas de los últimos 7 días - #73
TCExam es un sistema de evaluación asistida por computadora (CBA) para universidades, escuelas y empresas, que permite a educadores y capacitadores crear, programar, administrar y generar informes de encuestas, cuestionarios, pruebas y exámenes.
★ 621+0Variación de estrellas de los últimos 7 días - #74
Evaluador de expresiones simple, seguro, aislado y extensible para Python.
★ 611+0Variación de estrellas de los últimos 7 días - #75
Este repositorio contiene el código de evaluación para el artículo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI".
★ 594+1Variación de estrellas de los últimos 7 días - #76
Repositorio de herramientas para ayudar a evaluar diversos métodos de coincidencia de imágenes a partir de un par de ellas.
★ 594+0Variación de estrellas de los últimos 7 días - #77
Una colección de conjuntos de datos que emparejan preguntas con consultas SQL
★ 588+1Variación de estrellas de los últimos 7 días - #78
ParseBench: un benchmark de análisis de documentos para agentes de IA
★ 565+12Variación de estrellas de los últimos 7 días - #79
Meta Agents Research Environments es una plataforma integral diseñada para evaluar agentes de IA en escenarios dinámicos y realistas. A diferencia de los benchmarks estáticos, esta plataforma introduce entornos en evolución donde los agentes deben adaptar sus estrategias a medida que hay nueva información disponible, reflejando desafíos del mundo real.
★ 551+3Variación de estrellas de los últimos 7 días - #80
Conjunto de datos y benchmark para RAG en documentos internos de empresas.
★ 546+11Variación de estrellas de los últimos 7 días