Pular para o conteúdo principal
buildradar
Sign in
Tópico · evaluation

evaluation

Repositórios de código aberto acompanhados marcados com evaluation, ordenados por estrelas.

80 repositórios
  • RAG-FiT@IntelLabs

    Framework para aprimorar LLMs para tarefas de RAG usando ajuste fino.

    768+0Variação de estrelas nos últimos 7 dias
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Um poderoso kit de ferramentas para compressão de grandes modelos, incluindo LLMs, VLMs e modelos gerativos de vídeo.

    747+4Variação de estrelas nos últimos 7 dias
  • opik-openclaw@comet-ml

    🦞 Plugin oficial para OpenClaw que exporta rastreamentos de agentes para o Opik. Visualize e monitore o comportamento, custo, tokens, erros e muito mais do agente.

    725+0Variação de estrelas nos últimos 7 dias
  • iou-tracker@bochinski

    Implementação em Python do IOU Tracker.

    702+0Variação de estrelas nos últimos 7 dias
  • ranx@AmenRa

    ⚡️Uma biblioteca Python extremamente rápida para avaliação, comparação e fusão de ranqueamento 🐍

    698+4Variação de estrelas nos últimos 7 dias
  • long-form-factuality@google-deepmind

    Benchmarking de factualidade de formato longo em grandes modelos de linguagem. Código original para nosso artigo "Long-form factuality in large language models".

    693+2Variação de estrelas nos últimos 7 dias
  • ClawBench@TIGER-AI-Lab

    Benchmark de código aberto para agentes de IA de navegador em tarefas diárias.

    675+61Variação de estrelas nos últimos 7 dias
  • Awesome-LLM-Eval: uma lista com curadoria de ferramentas, conjuntos de dados/benchmarks, demonstrações, placares, artigos, documentos e modelos, focada principalmente na avaliação de LLMs.

    656-2Variação de estrelas nos últimos 7 dias
  • autoprompt@ucinlp

    AutoPrompt: Construção automática de prompts para Modelos de Linguagem Mascarados.

    641+0Variação de estrelas nos últimos 7 dias
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Confiabilidade em Modelos de Linguagem Grandes

    632+2Variação de estrelas nos últimos 7 dias
  • Um avaliador simples de expressões matemáticas e em pseudo-C# em um único arquivo C#. Também pode executar pequenos scripts semelhantes ao C#

    630+0Variação de estrelas nos últimos 7 dias
  • Um repositório de recursos para machine unlearning em grandes modelos de linguagem

    624+0Variação de estrelas nos últimos 7 dias
  • tcexam@tecnickcom

    TCExam é um sistema de avaliação baseada em computador (CBA/CBT) para universidades, escolas e empresas, que permite a educadores e instrutores criar, agendar, aplicar e gerar relatórios sobre pesquisas, questionários, testes e exames.

    621+0Variação de estrelas nos últimos 7 dias
  • simpleeval@danthedeckie

    Avaliador de expressões simples, seguro, isolado e extensível para Python

    611+0Variação de estrelas nos últimos 7 dias
  • MMMU@MMMU-Benchmark

    Este repositório contém código de avaliação para o artigo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

    594+1Variação de estrelas nos últimos 7 dias
  • image-matching-toolbox@GrumpyZhou

    Este é um repositório de ferramentas para ajudar a avaliar vários métodos que realizam correspondência de imagens a partir de um par de imagens.

    594+0Variação de estrelas nos últimos 7 dias
  • text2sql-data@jkkummerfeld

    Uma coleção de conjuntos de dados que associam perguntas a consultas SQL.

    588+1Variação de estrelas nos últimos 7 dias
  • ParseBench@run-llama

    ParseBench - Um benchmark de análise de documentos para agentes de IA

    565+12Variação de estrelas nos últimos 7 dias
  • Meta Agents Research Environments é uma plataforma abrangente projetada para avaliar agentes de IA em cenários dinâmicos e realistas. Ao contrário de benchmarks estáticos, esta plataforma introduz ambientes em evolução onde os agentes devem adaptar suas estratégias à medida que novas informações se tornam disponíveis, espelhando os desafios do mundo real.

    551+3Variação de estrelas nos últimos 7 dias
  • Dataset e benchmark para RAG em documentos internos de empresas.

    546+11Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos