Pular para o conteúdo principal
buildradar
Sign in
Tópico · evaluation

evaluation

Repositórios de código aberto acompanhados marcados com evaluation, ordenados por estrelas.

80 repositórios
  • evaluation-guidebook@huggingface

    Compartilhando insights práticos e conhecimento teórico sobre avaliação de LLM que reunimos ao gerenciar o Open LLM Leaderboard e projetar o lighteval!

    2.143+2Variação de estrelas nos últimos 7 dias
  • avalanche@ContinualAI

    Avalanche: uma biblioteca de ponta a ponta para aprendizado contínuo baseada em PyTorch.

    2.088+0Variação de estrelas nos últimos 7 dias
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Avaliando o estado da arte em IA.

    2.037-2Variação de estrelas nos últimos 7 dias
  • alpaca_eval@tatsu-lab

    Um avaliador automático para modelos de linguagem de seguimento de instruções. Validado por humanos, de alta qualidade, barato e rápido.

    2.012-1Variação de estrelas nos últimos 7 dias
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) Implementação oficial em Python para "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics".

    1.846+0Variação de estrelas nos últimos 7 dias
  • WFGY@onestardao

    O WFGY está caminhando para o WFGY 5.0 Polaris Protocol, um grande lançamento de código aberto para raciocínio de IA, RAG, agentes e fluxos de trabalho do mundo real. Inclui Mapa de Problemas, Cartão de Depuração Global, WFGY 4.0 e o Easter Egg CFV.

    1.786+1Variação de estrelas nos últimos 7 dias
  • EmoLLM@SmartFlowAI

    LLM para saúde mental, incluindo pré e pós-treinamento, conjunto de dados, avaliação, implantação e RAG, com modelos das séries InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama e GLM

    1.781+1Variação de estrelas nos últimos 7 dias
  • trpc-agent-go@trpc-group

    Um framework Go para criar sistemas de agentes de produção com fluxos de trabalho em grafo, ferramentas, memória, A2A, AG-UI, MCP, avaliação e observabilidade.

    1.760+12Variação de estrelas nos últimos 7 dias
  • ragbits@deepsense-ai

    Blocos de construção para o desenvolvimento rápido de aplicações de GenAI

    1.668+0Variação de estrelas nos últimos 7 dias
  • A página oficial do GitHub para o artigo de revisão "A Survey on Evaluation of Large Language Models".

    1.608-1Variação de estrelas nos últimos 7 dias
  • pycm@sepandhaghighi

    Biblioteca de matriz de confusão multiclasse em Python

    1.506+0Variação de estrelas nos últimos 7 dias
  • nlg-eval@Maluuba

    Código de avaliação para várias métricas automatizadas não supervisionadas para Geração de Linguagem Natural.

    1.391+0Variação de estrelas nos últimos 7 dias
  • lispy@abo-abo

    Edição de LISP curta e simples

    1.300+0Variação de estrelas nos últimos 7 dias
  • xai@EthicalML

    XAI - Uma caixa de ferramentas de explicabilidade para machine learning

    1.260+0Variação de estrelas nos últimos 7 dias
  • intellagent@plurai-ai

    Um framework para diagnóstico abrangente e otimização de agentes usando interações sintéticas realistas e simuladas

    1.257+0Variação de estrelas nos últimos 7 dias
  • KernelBench@ScalingIntelligence

    KernelBench: LLMs conseguem escrever kernels de GPU? - Benchmark + Toolkit com Torch -> CUDA (+ mais DSLs)

    1.227+7Variação de estrelas nos últimos 7 dias
  • kubetorch@run-house

    Distribua e execute cargas de trabalho de IA no Kubernetes magicamente em Python, como o PyTorch para infraestrutura de ML.

    1.224+0Variação de estrelas nos últimos 7 dias
  • fuzzbench@google

    FuzzBench - Benchmarking de fuzzers como serviço

    1.206+0Variação de estrelas nos últimos 7 dias
  • torch-fidelity@toshas

    Métricas de desempenho de alta fidelidade para modelos generativos em PyTorch

    1.200+1Variação de estrelas nos últimos 7 dias
  • Tracely-ai@Jwuthri

    CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.

    1.176-22Variação de estrelas nos últimos 7 dias
  • ncalc@ncalc

    NCalc é uma biblioteca de avaliação de expressões rápida e leve para .NET, projetada para flexibilidade e alto desempenho. Suporta uma ampla gama de operações matemáticas e lógicas.

    1.156+2Variação de estrelas nos últimos 7 dias
  • Gym@NVIDIA-NeMo

    Avalie e aprimore modelos e agentes usando ambientes

    1.155+7Variação de estrelas nos últimos 7 dias
  • prometheus-eval@prometheus-eval

    Avalie a resposta do seu LLM com Prometheus e GPT4 💯

    1.111+4Variação de estrelas nos últimos 7 dias
  • langsmith-sdk@langchain-ai

    Implementações do SDK do cliente LangSmith

    1.050+9Variação de estrelas nos últimos 7 dias
  • API SemanticKITTI para visualização de conjuntos de dados, processamento de dados e avaliação de resultados.

    898+3Variação de estrelas nos últimos 7 dias
  • deepfabric@nolabs-ai

    Gere sintéticos de alta qualidade, treine, meça e avalie em um único pipeline

    885+3Variação de estrelas nos últimos 7 dias
  • ClawProBench@suyoumo

    ClawProBench é um harness de benchmark voltado para o tempo de execução (live-first) para avaliar agentes de LLM no runtime OpenClaw, com avaliação determinística e confiabilidade de testes repetidos.

    823+0Variação de estrelas nos últimos 7 dias
  • OpenJudge@agentscope-ai

    OpenJudge: Uma estrutura unificada para avaliação holística e recompensas de qualidade

    820+14Variação de estrelas nos últimos 7 dias
  • gval@PaesslerAG

    Avaliação de expressões em Golang

    814+1Variação de estrelas nos últimos 7 dias
  • web-codegen-scorer@angular

    Web Codegen Scorer é uma ferramenta para avaliar a qualidade de código web gerado por LLMs.

    774+4Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos