Pular para o conteúdo principal
buildradar
Sign in
Tópico · evaluation

evaluation

Repositórios de código aberto acompanhados marcados com evaluation, ordenados por estrelas.

Repositórios
80
Total de estrelas
291.588
Média de estrelas
3.645
Participação
0,02%

Tópicos que aparecem com frequência ao lado de evaluation no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com evaluation.

  • fable-method@Sahir619

    O fluxo de trabalho Fable: como o Claude Fable 5 funcionava, destilado em habilidades que qualquer modelo pode executar, com a avaliação que mantém a integridade. Pensar / agir / provar.

    2.267
  • Tracely-ai@Jwuthri

    CI/CD nativo de rastreamento para agentes de IA — falhas de produção tornam-se testes de regressão que bloqueiam o PR. Detecte automaticamente, agrupe, congele em casos herméticos e reproduza em CI por custo zero.

    1.159
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 Plataforma de engenharia de IA de código aberto: avaliações de LLM, observabilidade, métricas, gerenciamento de prompts, playground, conjuntos de dados. Integra-se com OpenTelemetry, LangChain, SDK da OpenAI, LiteLLM e muito mais. 🍊YC W23

    33.909+372Variação de estrelas nos últimos 7 dias
  • mlflow@mlflow

    A plataforma de engenharia de IA de código aberto para agentes, LLMs e modelos de ML. O MLflow permite que equipes de todos os tamanhos depurem, avaliem, monitorem e otimizem aplicações de IA com qualidade de produção, controlando custos e gerenciando o acesso a modelos e dados.

    27.728+114Variação de estrelas nos últimos 7 dias
  • promptfoo@promptfoo

    Teste seus prompts, agentes e RAGs. Ferramenta de red teaming, pentesting e varredura de vulnerabilidades para IA. Compare o desempenho de GPT, Claude, Gemini, DeepSeek e outros. Utiliza configurações declarativas simples com integração via linha de comando e CI/CD. Utilizado pela OpenAI e Anthropic.

    24.664+215Variação de estrelas nos últimos 7 dias
  • opik@comet-ml

    Depure, avalie e monitore suas aplicações de LLM, sistemas RAG e fluxos de trabalho baseados em agentes com rastreamento abrangente, avaliações automatizadas e painéis prontos para produção.

    21.668+143Variação de estrelas nos últimos 7 dias
  • WeKnora@Tencent

    Plataforma de conhecimento LLM de código aberto: transforme documentos brutos em um RAG consultável, um agente de raciocínio autônomo e uma Wiki de auto-manutenção.

    20.899+581Variação de estrelas nos últimos 7 dias
  • ragas@vibrantlabsai

    Turbine as avaliações da sua aplicação LLM.

    15.541+123Variação de estrelas nos últimos 7 dias
  • oumi@oumi-ai

    Faça o ajuste fino, avalie e implante facilmente Qwen, Gemma ou qualquer LLM de pesos abertos!

    9.380+3Variação de estrelas nos últimos 7 dias
  • opencompass@open-compass

    OpenCompass é uma plataforma de avaliação de LLM, suportando uma ampla gama de modelos (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, etc.) em mais de 100 conjuntos de dados.

    7.374+48Variação de estrelas nos últimos 7 dias
  • helicone@Helicone

    🧊 Plataforma de observabilidade de LLM de código aberto. Uma linha de código para monitorar, avaliar e experimentar. YC W23 🍓

    6.116+23Variação de estrelas nos últimos 7 dias
  • coze-loop@coze-dev

    Plataforma de otimização de agentes de IA de próxima geração: o Cozeloop aborda desafios no desenvolvimento de agentes de IA, oferecendo recursos de gerenciamento de ciclo de vida completo, desde desenvolvimento, depuração e avaliação até monitoramento.

    5.706+7Variação de estrelas nos últimos 7 dias
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: Agora seu agente pode encontrar qualquer coisa no seu computador. Ele fica mais inteligente conforme você o utiliza com frequência.

    5.057+7Variação de estrelas nos últimos 7 dias
  • Kiln@Kiln-AI

    Construa, avalie e otimize sistemas de IA. Inclui avaliações, RAG, agentes, ajuste fino, geração de dados sintéticos, gerenciamento de conjuntos de dados, MCP e muito mais.

    5.037+7Variação de estrelas nos últimos 7 dias
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.

    4.383+11Variação de estrelas nos últimos 7 dias
  • VLMEvalKit@open-compass

    Kit de ferramentas de avaliação de código aberto para grandes modelos multimodais (LMMs), com suporte a mais de 220 LMMs e mais de 80 benchmarks.

    4.362+10Variação de estrelas nos últimos 7 dias
  • evo@MichaelGrupp

    Pacote Python para avaliação de odometria e SLAM.

    4.310+7Variação de estrelas nos últimos 7 dias
  • langwatch@langwatch

    A plataforma para avaliações de LLM e testes de agentes de IA.

    3.517+13Variação de estrelas nos últimos 7 dias
  • mteb@embeddings-benchmark

    MTEB: Avaliação de ponta para embeddings em diversos idiomas e modalidades.

    3.409+9Variação de estrelas nos últimos 7 dias
  • evalscope@modelscope

    Uma estrutura simplificada e personalizável para avaliação eficiente de grandes modelos (LLM, VLM, AIGC) e benchmarking de desempenho.

    3.331+47Variação de estrelas nos últimos 7 dias
  • SuperCLUE@CLUEbenchmark

    SuperCLUE: Benchmark abrangente para modelos de linguagem em chinês

    3.299-1Variação de estrelas nos últimos 7 dias
  • lmnr@lmnr-ai

    Laminar - plataforma de observabilidade de código aberto criada especificamente para agentes de IA. YC S24.

    3.210+24Variação de estrelas nos últimos 7 dias
  • klipse@viebel

    Klipse é um plugin JavaScript para incorporar trechos de código interativos em blogs técnicos.

    3.134+0Variação de estrelas nos últimos 7 dias
  • ChainForge@ianarawjo

    Um ambiente de programação visual de código aberto para testar prompts de LLMs.

    3.028+1Variação de estrelas nos últimos 7 dias
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes. Um sistema rigoroso de engenharia, avaliação, governança e portabilidade para habilidades de agentes reutilizáveis.

    2.557+160Variação de estrelas nos últimos 7 dias
  • lighteval@huggingface

    Lighteval é o seu kit de ferramentas completo para avaliar LLMs em múltiplos backends

    2.530+8Variação de estrelas nos últimos 7 dias
  • evaluate@huggingface

    🤗 Evaluate: Uma biblioteca para avaliar facilmente modelos e conjuntos de dados de aprendizado de máquina.

    2.480+2Variação de estrelas nos últimos 7 dias
  • uptrain@uptrain-ai

    UpTrain é uma plataforma unificada de código aberto para avaliar e melhorar aplicações de IA Generativa. Fornecemos notas para mais de 20 verificações pré-configuradas (cobrindo casos de uso de linguagem, código e embedding), realizamos análise de causa raiz em casos de falha e oferecemos insights sobre como resolvê-los.

    2.364+3Variação de estrelas nos últimos 7 dias
  • graph-rag-agent@1517005260

    Integração de GraphRAG, LightRAG e Neo4j-llm-graph-builder para construção e busca de grafos de conhecimento. Combina a tecnologia DeepSearch para raciocínio em RAG privado e inclui um framework de avaliação personalizado para GraphRAG.

    2.330+8Variação de estrelas nos últimos 7 dias
  • fable-method@Sahir619

    O fluxo de trabalho Fable: como o Claude Fable 5 funcionava, destilado em habilidades que qualquer modelo pode executar, com a avaliação que mantém a integridade. Pensar / agir / provar.

    2.267+23Variação de estrelas nos últimos 7 dias
  • inspector@MCPJam

    Plataforma de teste e avaliação para conversar, inspecionar e depurar servidores MCP, aplicativos MCP e aplicativos ChatGPT.

    2.177+23Variação de estrelas nos últimos 7 dias
  • 📰 Artigos e blogs essenciais sobre modelagem de contexto longo baseada em LLM 🔥

    2.165+2Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos