inference
Repositórios de código aberto acompanhados marcados com inference, ordenados por estrelas.
- #61
Gerencia o acesso unificado a serviços de IA generativa construídos sobre o Envoy Gateway.
★ 1.990+16Variação de estrelas nos últimos 7 dias - #62
Execute um LLM de 1 bilhão de parâmetros em uma placa de 10 dólares com 256 MB de RAM
★ 1.927+4Variação de estrelas nos últimos 7 dias - #63
O módulo de inferência para o AgiBot X1.
★ 1.835+1Variação de estrelas nos últimos 7 dias - #64★ 1.711+1Variação de estrelas nos últimos 7 dias
- #65
Servidor de inferência de CPU/GPU eficiente, escalável e de nível empresarial para modelos transformer do 🤗 Hugging Face 🚀
★ 1.690+0Variação de estrelas nos últimos 7 dias - #66★ 1.687+4Variação de estrelas nos últimos 7 dias
- #67
Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3
★ 1.613+33Variação de estrelas nos últimos 7 dias - #68
Roteie, gerencie e analise suas requisições de LLM em múltiplos provedores com uma interface de API unificada.
★ 1.594+8Variação de estrelas nos últimos 7 dias - #69
Um motor de inferência de alto desempenho para modelos LLM, VLM, DiT e REC, otimizado para diversos aceleradores de IA. É hospedado na OpenAtom Foundation.
★ 1.552+11Variação de estrelas nos últimos 7 dias - #70
Um runtime rápido e amigável para inferência de transformers (Bert, Albert, GPT2, Decoders, etc) em CPU e GPU.
★ 1.550+1Variação de estrelas nos últimos 7 dias - #71
Exportador de GPU Nvidia para Prometheus usando o binário nvidia-smi ou NVML
★ 1.550+4Variação de estrelas nos últimos 7 dias - #72
Implante um serviço de inferência de ML com baixo custo em menos de 10 linhas de código.
★ 1.343+0Variação de estrelas nos últimos 7 dias - #73
RTP-LLM: motor de inferência LLM de alto desempenho da Alibaba para diversas aplicações.
★ 1.325+6Variação de estrelas nos últimos 7 dias - #74
Inferência, ingestão e indexação de alto desempenho, modulares, seguras quanto à memória e prontas para produção, construídas em Rust 🦀
★ 1.305-1Variação de estrelas nos últimos 7 dias - #75
Pacote para inferência causal em grafos e configurações de pares. Inclui ferramentas para recuperação de estrutura de grafos e dependências.
★ 1.237+0Variação de estrelas nos últimos 7 dias - #76
Distribua e execute cargas de trabalho de IA no Kubernetes magicamente em Python, como o PyTorch para infraestrutura de ML.
★ 1.224+0Variação de estrelas nos últimos 7 dias - #77★ 1.201+5Variação de estrelas nos últimos 7 dias
- #78
Qualcomm® AI Hub Models é nossa coleção de modelos de aprendizado de máquina de última geração otimizados para desempenho (latência, memória, etc.) e prontos para implantação em dispositivos Qualcomm®.
★ 1.195+1Variação de estrelas nos últimos 7 dias - #79
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 1.118+143Variação de estrelas nos últimos 7 dias - #80
Servidor de inferência LLM nativo para Apple Silicon. Compatível com a API da OpenAI e Anthropic. Sem Python. Inclui o aplicativo MLX Core para macOS com chat, modo agente e chamada de ferramentas.
★ 1.115+245Variação de estrelas nos últimos 7 dias - #81
Construa seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão reduzida do vLLM.
★ 1.094+15Variação de estrelas nos últimos 7 dias - #82★ 975+1Variação de estrelas nos últimos 7 dias
- #83
MLX Studio - Casa de JANG_Q - Geração/Edição de Imagem + Chat/Código Tudo em um - + OpenClaw (Anthropic API)
★ 964+6Variação de estrelas nos últimos 7 dias - #84
Bolt é uma biblioteca de deep learning com alto desempenho e flexibilidade heterogênea.
★ 957+0Variação de estrelas nos últimos 7 dias - #85
📚 Introdução à Estatística Moderna - Um livro didático de código aberto de nível universitário com uma abordagem moderna que destaca relações multivariáveis e inferência baseada em simulação.
★ 944+1Variação de estrelas nos últimos 7 dias - #86★ 943+0Variação de estrelas nos últimos 7 dias
- #87
Servidor de inferência escalável para modelos otimizados com OpenVINO™
★ 927+5Variação de estrelas nos últimos 7 dias - #88★ 867+1Variação de estrelas nos últimos 7 dias
- #89
Um framework de visão computacional open source para criar e implantar aplicativos em minutos
★ 851-1Variação de estrelas nos últimos 7 dias - #90
PyTriton é uma interface estilo Flask/FastAPI que simplifica a implantação do Triton em ambientes Python.
★ 848+0Variação de estrelas nos últimos 7 dias