evaluation-framework
Repositórios de código aberto acompanhados marcados com evaluation-framework, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de evaluation-framework no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com evaluation-framework.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Teste seus prompts, agentes e RAGs. Ferramenta de red teaming, pentesting e varredura de vulnerabilidades para IA. Compare o desempenho de GPT, Claude, Gemini, DeepSeek e outros. Utiliza configurações declarativas simples com integração via linha de comando e CI/CD. Utilizado pela OpenAI e Anthropic.
★ 24.664+215Variação de estrelas nos últimos 7 dias - #2★ 17.953+184Variação de estrelas nos últimos 7 dias
- #3
Um framework para avaliação few-shot de modelos de linguagem.
★ 13.827+89Variação de estrelas nos últimos 7 dias - #4
Construa, avalie e otimize sistemas de IA. Inclui avaliações, RAG, agentes, ajuste fino, geração de dados sintéticos, gerenciamento de conjuntos de dados, MCP e muito mais.
★ 5.037+7Variação de estrelas nos últimos 7 dias - #5
Lighteval é o seu kit de ferramentas completo para avaliar LLMs em múltiplos backends
★ 2.533+8Variação de estrelas nos últimos 7 dias - #6
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Avaliando o estado da arte em IA.
★ 2.037-2Variação de estrelas nos últimos 7 dias - #7
Plataforma open-source de ponta a ponta para avaliar, observar e melhorar aplicações de LLM e agentes de IA. Rastreamento, avaliações, simulações, conjuntos de dados, gateway e guardrails. Auto-hospedável. Licença Apache 2.0.
★ 1.890+89Variação de estrelas nos últimos 7 dias - #8
Repositório para o Guia Definitivo de Agentes de IA
★ 1.528+422Variação de estrelas nos últimos 7 dias - #9
AgentLab: Um framework open-source para desenvolver, testar e avaliar agentes web em diversas tarefas, projetado para escalabilidade e reprodutibilidade.
★ 627+2Variação de estrelas nos últimos 7 dias - #10
Avaliação orientada a dados para aplicações baseadas em LLM
★ 517+1Variação de estrelas nos últimos 7 dias