llm-evaluation
Repositórios de código aberto acompanhados marcados com llm-evaluation, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de llm-evaluation no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com llm-evaluation.
- #1
CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.
★ 1.159 - #2
Uma biblioteca curada e direta dos melhores recursos para construir e avaliar agentes de IA — artigos, blogs, palestras, ferramentas e benchmarks. Mantida pela BenchFlow.
★ 849 - #3
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
★ 352 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 Plataforma de engenharia de IA de código aberto: avaliações de LLM, observabilidade, métricas, gerenciamento de prompts, playground, conjuntos de dados. Integra-se com OpenTelemetry, LangChain, SDK da OpenAI, LiteLLM e muito mais. 🍊YC W23
★ 33.909+372Variação de estrelas nos últimos 7 dias - #2
A plataforma de engenharia de IA de código aberto para agentes, LLMs e modelos de ML. O MLflow permite que equipes de todos os tamanhos depurem, avaliem, monitorem e otimizem aplicações de IA com qualidade de produção, controlando custos e gerenciando o acesso a modelos e dados.
★ 27.728+114Variação de estrelas nos últimos 7 dias - #3
Teste seus prompts, agentes e RAGs. Ferramenta de red teaming, pentesting e varredura de vulnerabilidades para IA. Compare o desempenho de GPT, Claude, Gemini, DeepSeek e outros. Utiliza configurações declarativas simples com integração via linha de comando e CI/CD. Utilizado pela OpenAI e Anthropic.
★ 24.664+215Variação de estrelas nos últimos 7 dias - #4
Depure, avalie e monitore suas aplicações de LLM, sistemas RAG e fluxos de trabalho baseados em agentes com rastreamento abrangente, avaliações automatizadas e painéis prontos para produção.
★ 21.668+143Variação de estrelas nos últimos 7 dias - #5★ 17.953+184Variação de estrelas nos últimos 7 dias
- #6
Auditoria independente de agentes de IA. Executada por humanos ou pelo próprio agente para responder à pergunta mais crucial na economia de agentes de IA: o agente está fazendo o que deveria fazer? Com o iFixAi, você obtém essa resposta em menos de 120 segundos.
★ 11.396+209Variação de estrelas nos últimos 7 dias - #7★ 11.243+101Variação de estrelas nos últimos 7 dias
- #8★ 9.071+181Variação de estrelas nos últimos 7 dias
- #9
非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。
★ 6.409+20Variação de estrelas nos últimos 7 dias - #10
🧊 Plataforma de observabilidade de LLM de código aberto. Uma linha de código para monitorar, avaliar e experimentar. YC W23 🍓
★ 6.116+23Variação de estrelas nos últimos 7 dias - #11
Uma plataforma full-stack de Red Teaming para IA que protege ecossistemas de IA por meio de varredura de agentes, habilidades, MCP, infraestrutura de IA e avaliação de jailbreak de LLM.
★ 6.058+713Variação de estrelas nos últimos 7 dias - #12
🐢 Biblioteca de código aberto para avaliação e teste de agentes de LLM
★ 5.792+31Variação de estrelas nos últimos 7 dias - #13
Agent OS: o agente torna-se mais inteligente por conta própria. Mantemos a linha: o comando de avaliação e o resultado esperado nunca entram no contrato de sucesso que entregamos a ele. Avaliação em estágios, loop de evolução orçado. Servidor MCP, 13 runtimes: Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro e mais.
★ 5.728+115Variação de estrelas nos últimos 7 dias - #14
O guia prático de LLMs: dos fundamentos à implementação de aplicações avançadas de LLM e RAG na AWS usando as melhores práticas de LLMOps
★ 5.302+14Variação de estrelas nos últimos 7 dias - #15
AutoRAG: Agora seu agente pode encontrar qualquer coisa no seu computador. Ele fica mais inteligente conforme você o utiliza com frequência.
★ 5.057+7Variação de estrelas nos últimos 7 dias - #16
Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.
★ 4.383+11Variação de estrelas nos últimos 7 dias - #17
Uma coleção de métodos científicos, processos, algoritmos e sistemas para construir histórias e modelos.
★ 3.674+2Variação de estrelas nos últimos 7 dias - #18★ 3.528+10Variação de estrelas nos últimos 7 dias
- #19
Laminar - plataforma de observabilidade de código aberto criada especificamente para agentes de IA. YC S24.
★ 3.210+24Variação de estrelas nos últimos 7 dias - #20
Recursos abrangentes sobre IA Generativa, incluindo um roteiro detalhado, projetos, casos de uso, preparação para entrevistas e preparação para codificação.
★ 2.609+7Variação de estrelas nos últimos 7 dias - #21
Scanner de vulnerabilidades LLM baseado em agentes / kit de red teaming de IA 🧪
★ 1.979+10Variação de estrelas nos últimos 7 dias - #22
Plataforma open-source de ponta a ponta para avaliar, observar e melhorar aplicações de LLM e agentes de IA. Rastreamento, avaliações, simulações, conjuntos de dados, gateway e guardrails. Auto-hospedável. Licença Apache 2.0.
★ 1.873+89Variação de estrelas nos últimos 7 dias - #23
Construa, aprimore e transforme conjuntos de dados usando modelos de IA sem código
★ 1.641+2Variação de estrelas nos últimos 7 dias - #24
Uma ferramenta poderosa para fuzzing automatizado de LLMs. Projetada para ajudar desenvolvedores e pesquisadores de segurança a identificar e mitigar potenciais jailbreaks em APIs de LLM.
★ 1.571+5Variação de estrelas nos últimos 7 dias - #25
O Prompty facilita a criação, gerenciamento, depuração e avaliação de prompts de LLM para suas aplicações de IA. O Prompty é uma classe de ativos e formato para prompts de LLM projetado para melhorar a observabilidade, compreensibilidade e portabilidade para desenvolvedores.
★ 1.254+3Variação de estrelas nos últimos 7 dias - #26
[JMLR 2026] "UQLM: Um pacote Python para quantificação de incerteza em grandes modelos de linguagem"
★ 1.193+1Variação de estrelas nos últimos 7 dias - #27
CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.
★ 1.159+331Variação de estrelas nos últimos 7 dias - #28
A pilha de melhoria contínua para agentes. Nossos dados de ambiente e avaliações impulsionam a melhoria e o monitoramento de agentes.
★ 1.058+1Variação de estrelas nos últimos 7 dias - #29
Agente de pesquisa de ações com IA, fluxos de trabalho resilientes, RAG baseado em evidências, relatórios versionados e avaliação de qualidade automatizada.
★ 1.033+6Variação de estrelas nos últimos 7 dias - #30
Uma biblioteca curada e direta dos melhores recursos para construir e avaliar agentes de IA — artigos, blogs, palestras, ferramentas e benchmarks. Mantida pela BenchFlow.
★ 849+10Variação de estrelas nos últimos 7 dias