Pular para o conteúdo principal
buildradar
Sign in
Tópico · llm-evaluation

llm-evaluation

Repositórios de código aberto acompanhados marcados com llm-evaluation, ordenados por estrelas.

Repositórios
36
Total de estrelas
232.805
Média de estrelas
6.467
Participação
0,01%

Tópicos que aparecem com frequência ao lado de llm-evaluation no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com llm-evaluation.

  • Tracely-ai@Jwuthri

    CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.

    1.159
  • awesome-evals@benchflow-ai

    Uma biblioteca curada e direta dos melhores recursos para construir e avaliar agentes de IA — artigos, blogs, palestras, ferramentas e benchmarks. Mantida pela BenchFlow.

    849
  • KADATH@i3T4AN

    Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

    352
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 Plataforma de engenharia de IA de código aberto: avaliações de LLM, observabilidade, métricas, gerenciamento de prompts, playground, conjuntos de dados. Integra-se com OpenTelemetry, LangChain, SDK da OpenAI, LiteLLM e muito mais. 🍊YC W23

    33.909+372Variação de estrelas nos últimos 7 dias
  • mlflow@mlflow

    A plataforma de engenharia de IA de código aberto para agentes, LLMs e modelos de ML. O MLflow permite que equipes de todos os tamanhos depurem, avaliem, monitorem e otimizem aplicações de IA com qualidade de produção, controlando custos e gerenciando o acesso a modelos e dados.

    27.728+114Variação de estrelas nos últimos 7 dias
  • promptfoo@promptfoo

    Teste seus prompts, agentes e RAGs. Ferramenta de red teaming, pentesting e varredura de vulnerabilidades para IA. Compare o desempenho de GPT, Claude, Gemini, DeepSeek e outros. Utiliza configurações declarativas simples com integração via linha de comando e CI/CD. Utilizado pela OpenAI e Anthropic.

    24.664+215Variação de estrelas nos últimos 7 dias
  • opik@comet-ml

    Depure, avalie e monitore suas aplicações de LLM, sistemas RAG e fluxos de trabalho baseados em agentes com rastreamento abrangente, avaliações automatizadas e painéis prontos para produção.

    21.668+143Variação de estrelas nos últimos 7 dias
  • deepeval@confident-ai

    O framework de avaliação de LLM.

    17.953+184Variação de estrelas nos últimos 7 dias
  • iFixAi@ifixai-ai

    Auditoria independente de agentes de IA. Executada por humanos ou pelo próprio agente para responder à pergunta mais crucial na economia de agentes de IA: o agente está fazendo o que deveria fazer? Com o iFixAi, você obtém essa resposta em menos de 120 segundos.

    11.396+209Variação de estrelas nos últimos 7 dias
  • phoenix@Arize-ai

    Observabilidade e Avaliação de IA

    11.243+101Variação de estrelas nos últimos 7 dias
  • garak@NVIDIA

    O scanner de vulnerabilidades para LLM

    9.071+181Variação de estrelas nos últimos 7 dias
  • 非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。

    6.409+20Variação de estrelas nos últimos 7 dias
  • helicone@Helicone

    🧊 Plataforma de observabilidade de LLM de código aberto. Uma linha de código para monitorar, avaliar e experimentar. YC W23 🍓

    6.116+23Variação de estrelas nos últimos 7 dias
  • AI-Infra-Guard@Tencent

    Uma plataforma full-stack de Red Teaming para IA que protege ecossistemas de IA por meio de varredura de agentes, habilidades, MCP, infraestrutura de IA e avaliação de jailbreak de LLM.

    6.058+713Variação de estrelas nos últimos 7 dias
  • giskard-oss@Giskard-AI

    🐢 Biblioteca de código aberto para avaliação e teste de agentes de LLM

    5.792+31Variação de estrelas nos últimos 7 dias
  • ouroboros@Q00

    Agent OS: o agente torna-se mais inteligente por conta própria. Mantemos a linha: o comando de avaliação e o resultado esperado nunca entram no contrato de sucesso que entregamos a ele. Avaliação em estágios, loop de evolução orçado. Servidor MCP, 13 runtimes: Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro e mais.

    5.728+115Variação de estrelas nos últimos 7 dias
  • LLM-Engineers-Handbook@PacktPublishing

    O guia prático de LLMs: dos fundamentos à implementação de aplicações avançadas de LLM e RAG na AWS usando as melhores práticas de LLMOps

    5.302+14Variação de estrelas nos últimos 7 dias
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: Agora seu agente pode encontrar qualquer coisa no seu computador. Ele fica mais inteligente conforme você o utiliza com frequência.

    5.057+7Variação de estrelas nos últimos 7 dias
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.

    4.383+11Variação de estrelas nos últimos 7 dias
  • AI-Engineer-Headquarters@hemansnation

    Uma coleção de métodos científicos, processos, algoritmos e sistemas para construir histórias e modelos.

    3.674+2Variação de estrelas nos últimos 7 dias
  • trulens@truera

    Avaliação e rastreamento para experimentos de LLM e agentes de IA.

    3.528+10Variação de estrelas nos últimos 7 dias
  • lmnr@lmnr-ai

    Laminar - plataforma de observabilidade de código aberto criada especificamente para agentes de IA. YC S24.

    3.210+24Variação de estrelas nos últimos 7 dias
  • generative-ai@genieincodebottle

    Recursos abrangentes sobre IA Generativa, incluindo um roteiro detalhado, projetos, casos de uso, preparação para entrevistas e preparação para codificação.

    2.609+7Variação de estrelas nos últimos 7 dias
  • agentic_security@msoedov

    Scanner de vulnerabilidades LLM baseado em agentes / kit de red teaming de IA 🧪

    1.979+10Variação de estrelas nos últimos 7 dias
  • future-agi@future-agi

    Plataforma open-source de ponta a ponta para avaliar, observar e melhorar aplicações de LLM e agentes de IA. Rastreamento, avaliações, simulações, conjuntos de dados, gateway e guardrails. Auto-hospedável. Licença Apache 2.0.

    1.873+89Variação de estrelas nos últimos 7 dias
  • aisheets@huggingface

    Construa, aprimore e transforme conjuntos de dados usando modelos de IA sem código

    1.641+2Variação de estrelas nos últimos 7 dias
  • FuzzyAI@cyberark

    Uma ferramenta poderosa para fuzzing automatizado de LLMs. Projetada para ajudar desenvolvedores e pesquisadores de segurança a identificar e mitigar potenciais jailbreaks em APIs de LLM.

    1.571+5Variação de estrelas nos últimos 7 dias
  • prompty@microsoft

    O Prompty facilita a criação, gerenciamento, depuração e avaliação de prompts de LLM para suas aplicações de IA. O Prompty é uma classe de ativos e formato para prompts de LLM projetado para melhorar a observabilidade, compreensibilidade e portabilidade para desenvolvedores.

    1.254+3Variação de estrelas nos últimos 7 dias
  • uqlm@cvs-health

    [JMLR 2026] "UQLM: Um pacote Python para quantificação de incerteza em grandes modelos de linguagem"

    1.193+1Variação de estrelas nos últimos 7 dias
  • Tracely-ai@Jwuthri

    CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.

    1.159+331Variação de estrelas nos últimos 7 dias
  • judgeval@JudgmentLabs

    A pilha de melhoria contínua para agentes. Nossos dados de ambiente e avaliações impulsionam a melhoria e o monitoramento de agentes.

    1.058+1Variação de estrelas nos últimos 7 dias
  • FinSight-AI@juanjuandog

    Agente de pesquisa de ações com IA, fluxos de trabalho resilientes, RAG baseado em evidências, relatórios versionados e avaliação de qualidade automatizada.

    1.033+6Variação de estrelas nos últimos 7 dias
  • awesome-evals@benchflow-ai

    Uma biblioteca curada e direta dos melhores recursos para construir e avaliar agentes de IA — artigos, blogs, palestras, ferramentas e benchmarks. Mantida pela BenchFlow.

    849+10Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos