evaluation
Repositórios de código aberto acompanhados marcados com evaluation, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de evaluation no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com evaluation.
- #1
O fluxo de trabalho Fable: como o Claude Fable 5 funcionava, destilado em habilidades que qualquer modelo pode executar, com a avaliação que mantém a integridade. Pensar / agir / provar.
★ 2.267 - #2
CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.
★ 1.159 - #3
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 Plataforma de engenharia de IA de código aberto: avaliações de LLM, observabilidade, métricas, gerenciamento de prompts, playground, conjuntos de dados. Integra-se com OpenTelemetry, LangChain, SDK da OpenAI, LiteLLM e muito mais. 🍊YC W23
★ 33.909+372Variação de estrelas nos últimos 7 dias - #2
A plataforma de engenharia de IA de código aberto para agentes, LLMs e modelos de ML. O MLflow permite que equipes de todos os tamanhos depurem, avaliem, monitorem e otimizem aplicações de IA com qualidade de produção, controlando custos e gerenciando o acesso a modelos e dados.
★ 27.728+114Variação de estrelas nos últimos 7 dias - #3
Teste seus prompts, agentes e RAGs. Ferramenta de red teaming, pentesting e varredura de vulnerabilidades para IA. Compare o desempenho de GPT, Claude, Gemini, DeepSeek e outros. Utiliza configurações declarativas simples com integração via linha de comando e CI/CD. Utilizado pela OpenAI e Anthropic.
★ 24.664+215Variação de estrelas nos últimos 7 dias - #4
Depure, avalie e monitore suas aplicações de LLM, sistemas RAG e fluxos de trabalho baseados em agentes com rastreamento abrangente, avaliações automatizadas e painéis prontos para produção.
★ 21.668+143Variação de estrelas nos últimos 7 dias - #5
Plataforma de conhecimento LLM de código aberto: transforme documentos brutos em um RAG consultável, um agente de raciocínio autônomo e uma Wiki de auto-manutenção.
★ 20.899+581Variação de estrelas nos últimos 7 dias - #6★ 15.541+123Variação de estrelas nos últimos 7 dias
- #7
Faça o ajuste fino, avalie e implante facilmente Qwen, Gemma ou qualquer LLM de pesos abertos!
★ 9.380+3Variação de estrelas nos últimos 7 dias - #8
OpenCompass é uma plataforma de avaliação de LLM, suportando uma ampla gama de modelos (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, etc.) em mais de 100 conjuntos de dados.
★ 7.374+48Variação de estrelas nos últimos 7 dias - #9
🧊 Plataforma de observabilidade de LLM de código aberto. Uma linha de código para monitorar, avaliar e experimentar. YC W23 🍓
★ 6.116+23Variação de estrelas nos últimos 7 dias - #10
Plataforma de otimização de agentes de IA de próxima geração: o Cozeloop aborda desafios no desenvolvimento de agentes de IA, oferecendo recursos de gerenciamento de ciclo de vida completo, desde desenvolvimento, depuração e avaliação até monitoramento.
★ 5.706+7Variação de estrelas nos últimos 7 dias - #11
AutoRAG: Agora seu agente pode encontrar qualquer coisa no seu computador. Ele fica mais inteligente conforme você o utiliza com frequência.
★ 5.057+7Variação de estrelas nos últimos 7 dias - #12
Construa, avalie e otimize sistemas de IA. Inclui avaliações, RAG, agentes, ajuste fino, geração de dados sintéticos, gerenciamento de conjuntos de dados, MCP e muito mais.
★ 5.037+7Variação de estrelas nos últimos 7 dias - #13
Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.
★ 4.383+11Variação de estrelas nos últimos 7 dias - #14
Kit de ferramentas de avaliação de código aberto para grandes modelos multimodais (LMMs), com suporte a mais de 220 LMMs e mais de 80 benchmarks.
★ 4.362+10Variação de estrelas nos últimos 7 dias - #15★ 4.310+7Variação de estrelas nos últimos 7 dias
- #16★ 3.517+13Variação de estrelas nos últimos 7 dias
- #17
MTEB: Avaliação de ponta para embeddings em diversos idiomas e modalidades.
★ 3.409+9Variação de estrelas nos últimos 7 dias - #18
Uma estrutura simplificada e personalizável para avaliação eficiente de grandes modelos (LLM, VLM, AIGC) e benchmarking de desempenho.
★ 3.331+47Variação de estrelas nos últimos 7 dias - #19★ 3.299-1Variação de estrelas nos últimos 7 dias
- #20
Laminar - plataforma de observabilidade de código aberto criada especificamente para agentes de IA. YC S24.
★ 3.210+24Variação de estrelas nos últimos 7 dias - #21
Klipse é um plugin JavaScript para incorporar trechos de código interativos em blogs técnicos.
★ 3.134+0Variação de estrelas nos últimos 7 dias - #22
Um ambiente de programação visual de código aberto para testar prompts de LLMs.
★ 3.028+1Variação de estrelas nos últimos 7 dias - #23
YAO = Yielding AI Outcomes. Um sistema rigoroso de engenharia, avaliação, governança e portabilidade para habilidades de agentes reutilizáveis.
★ 2.557+160Variação de estrelas nos últimos 7 dias - #24
Lighteval é o seu kit de ferramentas completo para avaliar LLMs em múltiplos backends
★ 2.530+8Variação de estrelas nos últimos 7 dias - #25
🤗 Evaluate: Uma biblioteca para avaliar facilmente modelos e conjuntos de dados de aprendizado de máquina.
★ 2.480+2Variação de estrelas nos últimos 7 dias - #26
UpTrain é uma plataforma unificada de código aberto para avaliar e melhorar aplicações de IA Generativa. Fornecemos notas para mais de 20 verificações pré-configuradas (cobrindo casos de uso de linguagem, código e embedding), realizamos análise de causa raiz em casos de falha e oferecemos insights sobre como resolvê-los.
★ 2.364+3Variação de estrelas nos últimos 7 dias - #27
Integração de GraphRAG, LightRAG e Neo4j-llm-graph-builder para construção e busca de grafos de conhecimento. Combina a tecnologia DeepSearch para raciocínio em RAG privado e inclui um framework de avaliação personalizado para GraphRAG.
★ 2.330+8Variação de estrelas nos últimos 7 dias - #28
O fluxo de trabalho Fable: como o Claude Fable 5 funcionava, destilado em habilidades que qualquer modelo pode executar, com a avaliação que mantém a integridade. Pensar / agir / provar.
★ 2.267+23Variação de estrelas nos últimos 7 dias - #29
Plataforma de teste e avaliação para conversar, inspecionar e depurar servidores MCP, aplicativos MCP e aplicativos ChatGPT.
★ 2.177+23Variação de estrelas nos últimos 7 dias - #30
📰 Artigos e blogs essenciais sobre modelagem de contexto longo baseada em LLM 🔥
★ 2.165+2Variação de estrelas nos últimos 7 dias