Pular para o conteúdo principal
buildradar
Sign in
Tópico · inference

inference

Repositórios de código aberto acompanhados marcados com inference, ordenados por estrelas.

120 repositórios
  • ai-gateway@envoyproxy

    Gerencia o acesso unificado a serviços de IA generativa construídos sobre o Envoy Gateway.

    1.990+16Variação de estrelas nos últimos 7 dias
  • picolm@RightNow-AI

    Execute um LLM de 1 bilhão de parâmetros em uma placa de 10 dólares com 256 MB de RAM

    1.927+4Variação de estrelas nos últimos 7 dias
  • agibot_x1_infer@AgibotTech

    O módulo de inferência para o AgiBot X1.

    1.835+1Variação de estrelas nos últimos 7 dias
  • NNPACK@Maratyszcza

    Pacote de aceleração para redes neurais em CPUs multi-core

    1.711+1Variação de estrelas nos últimos 7 dias
  • Servidor de inferência de CPU/GPU eficiente, escalável e de nível empresarial para modelos transformer do 🤗 Hugging Face 🚀

    1.690+0Variação de estrelas nos últimos 7 dias
  • uzu@trymirai

    Um motor de inferência de alto desempenho para modelos de IA

    1.687+4Variação de estrelas nos últimos 7 dias
  • InferenceX@SemiAnalysisAI

    Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3

    1.613+33Variação de estrelas nos últimos 7 dias
  • llmgateway@theopenco

    Roteie, gerencie e analise suas requisições de LLM em múltiplos provedores com uma interface de API unificada.

    1.594+8Variação de estrelas nos últimos 7 dias
  • xllm@xLLM-AI

    Um motor de inferência de alto desempenho para modelos LLM, VLM, DiT e REC, otimizado para diversos aceleradores de IA. É hospedado na OpenAtom Foundation.

    1.552+11Variação de estrelas nos últimos 7 dias
  • Um runtime rápido e amigável para inferência de transformers (Bert, Albert, GPT2, Decoders, etc) em CPU e GPU.

    1.550+1Variação de estrelas nos últimos 7 dias
  • Exportador de GPU Nvidia para Prometheus usando o binário nvidia-smi ou NVML

    1.550+4Variação de estrelas nos últimos 7 dias
  • budgetml@ebhy

    Implante um serviço de inferência de ML com baixo custo em menos de 10 linhas de código.

    1.343+0Variação de estrelas nos últimos 7 dias
  • rtp-llm@alibaba

    RTP-LLM: motor de inferência LLM de alto desempenho da Alibaba para diversas aplicações.

    1.325+6Variação de estrelas nos últimos 7 dias
  • EmbedAnything@StarlightSearch

    Inferência, ingestão e indexação de alto desempenho, modulares, seguras quanto à memória e prontas para produção, construídas em Rust 🦀

    1.305-1Variação de estrelas nos últimos 7 dias
  • CausalDiscoveryToolbox@FenTechSolutions

    Pacote para inferência causal em grafos e configurações de pares. Inclui ferramentas para recuperação de estrutura de grafos e dependências.

    1.237+0Variação de estrelas nos últimos 7 dias
  • kubetorch@run-house

    Distribua e execute cargas de trabalho de IA no Kubernetes magicamente em Python, como o PyTorch para infraestrutura de ML.

    1.224+0Variação de estrelas nos últimos 7 dias
  • kvpress@NVIDIA

    Compressão de cache KV para LLM simplificada

    1.201+5Variação de estrelas nos últimos 7 dias
  • ai-hub-models@qualcomm

    Qualcomm® AI Hub Models é nossa coleção de modelos de aprendizado de máquina de última geração otimizados para desempenho (latência, memória, etc.) e prontos para implantação em dispositivos Qualcomm®.

    1.195+1Variação de estrelas nos últimos 7 dias
  • sglang-omni@sgl-project

    O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.

    1.118+143Variação de estrelas nos últimos 7 dias
  • mlx-serve@ddalcu

    Servidor de inferência LLM nativo para Apple Silicon. Compatível com a API da OpenAI e Anthropic. Sem Python. Inclui o aplicativo MLX Core para macOS com chat, modo agente e chamada de ferramentas.

    1.115+245Variação de estrelas nos últimos 7 dias
  • tiny-vllm@jmaczan

    Construa seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão reduzida do vLLM.

    1.094+15Variação de estrelas nos últimos 7 dias
  • Nanoflow@efeslab

    Uma estrutura de atendimento de alto desempenho orientada a vazão para LLMs

    975+1Variação de estrelas nos últimos 7 dias
  • mlxstudio@jjang-ai

    MLX Studio - Casa de JANG_Q - Geração/Edição de Imagem + Chat/Código Tudo em um - + OpenClaw (Anthropic API)

    964+6Variação de estrelas nos últimos 7 dias
  • bolt@huawei-noah

    Bolt é uma biblioteca de deep learning com alto desempenho e flexibilidade heterogênea.

    957+0Variação de estrelas nos últimos 7 dias
  • ims@OpenIntroStat

    📚 Introdução à Estatística Moderna - Um livro didático de código aberto de nível universitário com uma abordagem moderna que destaca relações multivariáveis e inferência baseada em simulação.

    944+1Variação de estrelas nos últimos 7 dias
  • neuropod@uber

    Uma interface uniforme para executar modelos de deep learning de múltiplos frameworks

    943+0Variação de estrelas nos últimos 7 dias
  • model_server@openvinotoolkit

    Servidor de inferência escalável para modelos otimizados com OpenVINO™

    927+5Variação de estrelas nos últimos 7 dias
  • bark.cpp@PABannier

    Modelo Bark da Suno AI em C/C++ para geração rápida de texto para fala.

    867+1Variação de estrelas nos últimos 7 dias
  • pipeless@pipeless-ai

    Um framework de visão computacional open source para criar e implantar aplicativos em minutos

    851-1Variação de estrelas nos últimos 7 dias
  • pytriton@triton-inference-server

    PyTriton é uma interface estilo Flask/FastAPI que simplifica a implantação do Triton em ambientes Python.

    848+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos