evaluation
Repositórios de código aberto acompanhados marcados com evaluation, ordenados por estrelas.
- #61★ 768+0Variação de estrelas nos últimos 7 dias
- #62
[EMNLP 2024 & AAAI 2026] Um poderoso kit de ferramentas para compressão de grandes modelos, incluindo LLMs, VLMs e modelos gerativos de vídeo.
★ 747+4Variação de estrelas nos últimos 7 dias - #63
🦞 Plugin oficial para OpenClaw que exporta rastreamentos de agentes para o Opik. Visualize e monitore o comportamento, custo, tokens, erros e muito mais do agente.
★ 725+0Variação de estrelas nos últimos 7 dias - #64
Implementação em Python do IOU Tracker.
★ 702+0Variação de estrelas nos últimos 7 dias - #65
⚡️Uma biblioteca Python extremamente rápida para avaliação, comparação e fusão de ranqueamento 🐍
★ 698+4Variação de estrelas nos últimos 7 dias - #66
Benchmarking de factualidade de formato longo em grandes modelos de linguagem. Código original para nosso artigo "Long-form factuality in large language models".
★ 693+2Variação de estrelas nos últimos 7 dias - #67
Benchmark de código aberto para agentes de IA de navegador em tarefas diárias.
★ 675+61Variação de estrelas nos últimos 7 dias - #68
Awesome-LLM-Eval: uma lista com curadoria de ferramentas, conjuntos de dados/benchmarks, demonstrações, placares, artigos, documentos e modelos, focada principalmente na avaliação de LLMs.
★ 656-2Variação de estrelas nos últimos 7 dias - #69
AutoPrompt: Construção automática de prompts para Modelos de Linguagem Mascarados.
★ 641+0Variação de estrelas nos últimos 7 dias - #70★ 632+2Variação de estrelas nos últimos 7 dias
- #71
Um avaliador simples de expressões matemáticas e em pseudo-C# em um único arquivo C#. Também pode executar pequenos scripts semelhantes ao C#
★ 630+0Variação de estrelas nos últimos 7 dias - #72
Um repositório de recursos para machine unlearning em grandes modelos de linguagem
★ 624+0Variação de estrelas nos últimos 7 dias - #73
TCExam é um sistema de avaliação baseada em computador (CBA/CBT) para universidades, escolas e empresas, que permite a educadores e instrutores criar, agendar, aplicar e gerar relatórios sobre pesquisas, questionários, testes e exames.
★ 621+0Variação de estrelas nos últimos 7 dias - #74
Avaliador de expressões simples, seguro, isolado e extensível para Python
★ 611+0Variação de estrelas nos últimos 7 dias - #75
Este repositório contém código de avaliação para o artigo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 594+1Variação de estrelas nos últimos 7 dias - #76
Este é um repositório de ferramentas para ajudar a avaliar vários métodos que realizam correspondência de imagens a partir de um par de imagens.
★ 594+0Variação de estrelas nos últimos 7 dias - #77
Uma coleção de conjuntos de dados que associam perguntas a consultas SQL.
★ 588+1Variação de estrelas nos últimos 7 dias - #78
ParseBench - Um benchmark de análise de documentos para agentes de IA
★ 565+12Variação de estrelas nos últimos 7 dias - #79
Meta Agents Research Environments é uma plataforma abrangente projetada para avaliar agentes de IA em cenários dinâmicos e realistas. Ao contrário de benchmarks estáticos, esta plataforma introduz ambientes em evolução onde os agentes devem adaptar suas estratégias à medida que novas informações se tornam disponíveis, espelhando os desafios do mundo real.
★ 551+3Variação de estrelas nos últimos 7 dias - #80
Dataset e benchmark para RAG em documentos internos de empresas.
★ 546+11Variação de estrelas nos últimos 7 dias