Saltar al contenido principal
buildradar
Sign in
Tema · evaluation

evaluation

Repositorios de código abierto monitorizados etiquetados con evaluation, ordenados por estrellas.

80 repositorios
  • RAG-FiT@IntelLabs

    Framework para mejorar LLMs en tareas de RAG mediante ajuste fino (fine-tuning).

    768+0Variación de estrellas de los últimos 7 días
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Un potente kit de herramientas para comprimir modelos grandes, incluyendo LLMs, VLMs y modelos generativos de video.

    747+4Variación de estrellas de los últimos 7 días
  • opik-openclaw@comet-ml

    Plugin oficial para OpenClaw que exporta trazas de agentes a Opik. Visualiza y monitorea el comportamiento del agente, costos, tokens, errores y más.

    725+0Variación de estrellas de los últimos 7 días
  • iou-tracker@bochinski

    Implementación en Python del rastreador IOU

    702+0Variación de estrellas de los últimos 7 días
  • ranx@AmenRa

    ⚡️ Una biblioteca de Python ultrarrápida para evaluación, comparación y fusión de rankings 🐍

    698+4Variación de estrellas de los últimos 7 días
  • long-form-factuality@google-deepmind

    Evaluación comparativa de la veracidad en textos largos para modelos de lenguaje extensos. Código original para nuestro artículo "Long-form factuality in large language models".

    693+2Variación de estrellas de los últimos 7 días
  • ClawBench@TIGER-AI-Lab

    Benchmark de código abierto para agentes de IA en navegadores para tareas diarias.

    675+61Variación de estrellas de los últimos 7 días
  • Awesome-LLM-Eval: una lista curada de herramientas, conjuntos de datos/benchmarks, demos, tablas de clasificación, artículos, documentación y modelos, enfocada principalmente en la evaluación de LLMs.

    656-2Variación de estrellas de los últimos 7 días
  • autoprompt@ucinlp

    AutoPrompt: Construcción automática de prompts para modelos de lenguaje enmascarados.

    641+0Variación de estrellas de los últimos 7 días
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Confiabilidad en modelos de lenguaje de gran tamaño.

    632+2Variación de estrellas de los últimos 7 días
  • Un evaluador simple de expresiones matemáticas y pseudo C# en un solo archivo C#. También puede ejecutar pequeños scripts similares a C#

    630+0Variación de estrellas de los últimos 7 días
  • Repositorio de recursos sobre machine unlearning en modelos de lenguaje de gran tamaño

    624+0Variación de estrellas de los últimos 7 días
  • tcexam@tecnickcom

    TCExam es un sistema de evaluación asistida por computadora (CBA) para universidades, escuelas y empresas, que permite a educadores y capacitadores crear, programar, administrar y generar informes de encuestas, cuestionarios, pruebas y exámenes.

    621+0Variación de estrellas de los últimos 7 días
  • simpleeval@danthedeckie

    Evaluador de expresiones simple, seguro, aislado y extensible para Python.

    611+0Variación de estrellas de los últimos 7 días
  • MMMU@MMMU-Benchmark

    Este repositorio contiene el código de evaluación para el artículo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI".

    594+1Variación de estrellas de los últimos 7 días
  • image-matching-toolbox@GrumpyZhou

    Repositorio de herramientas para ayudar a evaluar diversos métodos de coincidencia de imágenes a partir de un par de ellas.

    594+0Variación de estrellas de los últimos 7 días
  • text2sql-data@jkkummerfeld

    Una colección de conjuntos de datos que emparejan preguntas con consultas SQL

    588+1Variación de estrellas de los últimos 7 días
  • ParseBench@run-llama

    ParseBench: un benchmark de análisis de documentos para agentes de IA

    565+12Variación de estrellas de los últimos 7 días
  • Meta Agents Research Environments es una plataforma integral diseñada para evaluar agentes de IA en escenarios dinámicos y realistas. A diferencia de los benchmarks estáticos, esta plataforma introduce entornos en evolución donde los agentes deben adaptar sus estrategias a medida que hay nueva información disponible, reflejando desafíos del mundo real.

    551+3Variación de estrellas de los últimos 7 días
  • Conjunto de datos y benchmark para RAG en documentos internos de empresas.

    546+11Variación de estrellas de los últimos 7 días
← Volver a temas