evaluation
Repositórios de código aberto acompanhados marcados com evaluation, ordenados por estrelas.
- #31
Compartilhando insights práticos e conhecimento teórico sobre avaliação de LLM que reunimos ao gerenciar o Open LLM Leaderboard e projetar o lighteval!
★ 2.143+2Variação de estrelas nos últimos 7 dias - #32
Avalanche: uma biblioteca de ponta a ponta para aprendizado contínuo baseada em PyTorch.
★ 2.088+0Variação de estrelas nos últimos 7 dias - #33
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Avaliando o estado da arte em IA.
★ 2.037-2Variação de estrelas nos últimos 7 dias - #34
Um avaliador automático para modelos de linguagem de seguimento de instruções. Validado por humanos, de alta qualidade, barato e rápido.
★ 2.012-1Variação de estrelas nos últimos 7 dias - #35
(IROS 2020, ECCVW 2020) Implementação oficial em Python para "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics".
★ 1.846+0Variação de estrelas nos últimos 7 dias - #36
O WFGY está caminhando para o WFGY 5.0 Polaris Protocol, um grande lançamento de código aberto para raciocínio de IA, RAG, agentes e fluxos de trabalho do mundo real. Inclui Mapa de Problemas, Cartão de Depuração Global, WFGY 4.0 e o Easter Egg CFV.
★ 1.786+1Variação de estrelas nos últimos 7 dias - #37
LLM para saúde mental, incluindo pré e pós-treinamento, conjunto de dados, avaliação, implantação e RAG, com modelos das séries InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama e GLM
★ 1.781+1Variação de estrelas nos últimos 7 dias - #38
Um framework Go para criar sistemas de agentes de produção com fluxos de trabalho em grafo, ferramentas, memória, A2A, AG-UI, MCP, avaliação e observabilidade.
★ 1.760+12Variação de estrelas nos últimos 7 dias - #39★ 1.668+0Variação de estrelas nos últimos 7 dias
- #40
A página oficial do GitHub para o artigo de revisão "A Survey on Evaluation of Large Language Models".
★ 1.608-1Variação de estrelas nos últimos 7 dias - #41★ 1.506+0Variação de estrelas nos últimos 7 dias
- #42
Código de avaliação para várias métricas automatizadas não supervisionadas para Geração de Linguagem Natural.
★ 1.391+0Variação de estrelas nos últimos 7 dias - #43★ 1.300+0Variação de estrelas nos últimos 7 dias
- #44★ 1.260+0Variação de estrelas nos últimos 7 dias
- #45
Um framework para diagnóstico abrangente e otimização de agentes usando interações sintéticas realistas e simuladas
★ 1.257+0Variação de estrelas nos últimos 7 dias - #46
KernelBench: LLMs conseguem escrever kernels de GPU? - Benchmark + Toolkit com Torch -> CUDA (+ mais DSLs)
★ 1.227+7Variação de estrelas nos últimos 7 dias - #47
Distribua e execute cargas de trabalho de IA no Kubernetes magicamente em Python, como o PyTorch para infraestrutura de ML.
★ 1.224+0Variação de estrelas nos últimos 7 dias - #48★ 1.206+0Variação de estrelas nos últimos 7 dias
- #49
Métricas de desempenho de alta fidelidade para modelos generativos em PyTorch
★ 1.200+1Variação de estrelas nos últimos 7 dias - #50
CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.
★ 1.176-22Variação de estrelas nos últimos 7 dias - #51
NCalc é uma biblioteca de avaliação de expressões rápida e leve para .NET, projetada para flexibilidade e alto desempenho. Suporta uma ampla gama de operações matemáticas e lógicas.
★ 1.156+2Variação de estrelas nos últimos 7 dias - #52★ 1.155+7Variação de estrelas nos últimos 7 dias
- #53
Avalie a resposta do seu LLM com Prometheus e GPT4 💯
★ 1.111+4Variação de estrelas nos últimos 7 dias - #54
Implementações do SDK do cliente LangSmith
★ 1.050+9Variação de estrelas nos últimos 7 dias - #55
API SemanticKITTI para visualização de conjuntos de dados, processamento de dados e avaliação de resultados.
★ 898+3Variação de estrelas nos últimos 7 dias - #56
Gere sintéticos de alta qualidade, treine, meça e avalie em um único pipeline
★ 885+3Variação de estrelas nos últimos 7 dias - #57
ClawProBench é um harness de benchmark voltado para o tempo de execução (live-first) para avaliar agentes de LLM no runtime OpenClaw, com avaliação determinística e confiabilidade de testes repetidos.
★ 823+0Variação de estrelas nos últimos 7 dias - #58
OpenJudge: Uma estrutura unificada para avaliação holística e recompensas de qualidade
★ 820+14Variação de estrelas nos últimos 7 dias - #59★ 814+1Variação de estrelas nos últimos 7 dias
- #60
Web Codegen Scorer é uma ferramenta para avaliar a qualidade de código web gerado por LLMs.
★ 774+4Variação de estrelas nos últimos 7 dias