inference-engine
Repositórios de código aberto acompanhados marcados com inference-engine, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de inference-engine no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com inference-engine.
- #1
Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.
★ 6.897 - #2
Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.
★ 624 - #3
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 552
- #1
Análises profundas de código-fonte, design de sistemas e blogs de engenharia
★ 13.220+3Variação de estrelas nos últimos 7 dias - #2
Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.
★ 6.897+485Variação de estrelas nos últimos 7 dias - #3
FEDML - A biblioteca de ML unificada e escalável para treinamento distribuído em larga escala, serviço de modelos e aprendizado federado. O FEDML Launch, um agendador cross-cloud, permite executar qualquer trabalho de IA em qualquer nuvem de GPU ou cluster local. Construída sobre esta biblioteca, a TensorOpera AI (https://TensorOpera.ai) é sua plataforma de IA generativa em escala.
★ 4.061-1Variação de estrelas nos últimos 7 dias - #4
Excelente projeto para processos seletivos e estágios! Guia passo a passo para implementar uma biblioteca de inferência de deep learning de alto desempenho do zero, com suporte a modelos como llama2, Unet, Yolov5, Resnet e outros.
★ 3.497+1Variação de estrelas nos últimos 7 dias - #5
Implementação de motor de regras em Golang
★ 2.522+0Variação de estrelas nos últimos 7 dias - #6★ 1.964+1Variação de estrelas nos últimos 7 dias
- #7★ 1.844+2Variação de estrelas nos últimos 7 dias
- #8
Velocidades 3x mais rápidas no MLX | Qwen 3.8 27B | Decodificação especulativa MTP nativa em Apple Silicon sem necessidade de rascunhador externo.
★ 1.805+235Variação de estrelas nos últimos 7 dias - #9
Um motor de inferência de alto desempenho para modelos LLM, VLM, DiT e REC, otimizado para diversos aceleradores de IA. É hospedado na OpenAtom Foundation.
★ 1.541+12Variação de estrelas nos últimos 7 dias - #10
Qualcomm® AI Hub Models é nossa coleção de modelos de aprendizado de máquina de última geração otimizados para desempenho (latência, memória, etc.) e prontos para implantação em dispositivos Qualcomm®.
★ 1.194+3Variação de estrelas nos últimos 7 dias - #11
Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais
★ 1.145+5Variação de estrelas nos últimos 7 dias - #12
Paddle.js é um projeto web para o Baidu PaddlePaddle, um framework de deep learning de código aberto que roda no navegador. O Paddle.js pode carregar modelos pré-treinados ou converter modelos do paddle-hub usando suas ferramentas de conversão. Pode ser executado em qualquer navegador com suporte a WebGL/WebGPU/WebAssembly, além de Baidu Smartprogram e WX miniprogram.
★ 1.103+0Variação de estrelas nos últimos 7 dias - #13
NobodyWho é um mecanismo de inferência que permite executar LLMs localmente e de forma eficiente em qualquer dispositivo.
★ 1.081+11Variação de estrelas nos últimos 7 dias - #14
MLX Studio - Casa de JANG_Q - Geração/Edição de Imagem + Chat/Código Tudo em um - + OpenClaw (Anthropic API)
★ 960+11Variação de estrelas nos últimos 7 dias - #15
Um motor de aceleração de inferência de LLM altamente otimizado para Llama e suas variantes.
★ 908+0Variação de estrelas nos últimos 7 dias - #16★ 849+1Variação de estrelas nos últimos 7 dias
- #17
Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2
★ 660+4Variação de estrelas nos últimos 7 dias - #18
Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.
★ 624+98Variação de estrelas nos últimos 7 dias - #19
Yet Another Language Model: inferência de LLM em C++/CUDA, sem bibliotecas além de I/O.
★ 597+1Variação de estrelas nos últimos 7 dias - #20
Uma representação base comum de código-fonte Python para pylint e outros projetos
★ 582+1Variação de estrelas nos últimos 7 dias - #21
Projeto para recrutamento e estágios, guiando você na implementação do zero de um framework de inferência de LLM com suporte a Llama2/3 e Qwen2.5.
★ 572+9Variação de estrelas nos últimos 7 dias - #22
From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.
★ 552+35Variação de estrelas nos últimos 7 dias - #23
Krasis é um runtime LLM híbrido focado na execução eficiente de modelos maiores em hardware de nível de consumidor com VRAM limitada.
★ 516+3Variação de estrelas nos últimos 7 dias - #24
Inference engine for Intel devices. Serve LLMs, VLMs, Whisper, Kokoro-TTS, Embedding and Rerank models over OpenAI endpoints.
★ 513+4Variação de estrelas nos últimos 7 dias