Pular para o conteúdo principal
buildradar
Sign in
Tópico · inference-engine

inference-engine

Repositórios de código aberto acompanhados marcados com inference-engine, ordenados por estrelas.

Repositórios
24
Total de estrelas
48.964
Média de estrelas
2.040
Participação
0,00%

Tópicos que aparecem com frequência ao lado de inference-engine no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com inference-engine.

  • kimi-k3-in-c@FareedKhan-dev

    Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.

    6.897
  • mlx-dspark@ARahim3

    Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.

    624
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    552
  • Análises profundas de código-fonte, design de sistemas e blogs de engenharia

    13.220+3Variação de estrelas nos últimos 7 dias
  • kimi-k3-in-c@FareedKhan-dev

    Um Kimi K3 de 2,78 trilhões de parâmetros executando inferência em uma única CPU com 8,24 GB de RAM. C99 portátil: sem BLAS, sem framework, sem GPU.

    6.897+485Variação de estrelas nos últimos 7 dias
  • FedML@FedML-AI

    FEDML - A biblioteca de ML unificada e escalável para treinamento distribuído em larga escala, serviço de modelos e aprendizado federado. O FEDML Launch, um agendador cross-cloud, permite executar qualquer trabalho de IA em qualquer nuvem de GPU ou cluster local. Construída sobre esta biblioteca, a TensorOpera AI (https://TensorOpera.ai) é sua plataforma de IA generativa em escala.

    4.061-1Variação de estrelas nos últimos 7 dias
  • KuiperInfer@zjhellofss

    Excelente projeto para processos seletivos e estágios! Guia passo a passo para implementar uma biblioteca de inferência de deep learning de alto desempenho do zero, com suporte a modelos como llama2, Unet, Yolov5, Resnet e outros.

    3.497+1Variação de estrelas nos últimos 7 dias
  • grule-rule-engine@hyperjumptech

    Implementação de motor de regras em Golang

    2.522+0Variação de estrelas nos últimos 7 dias
  • onediff@siliconflow

    OneDiff: Uma biblioteca de aceleração pronta para uso para modelos de difusão.

    1.964+1Variação de estrelas nos últimos 7 dias
  • sonar@dphnAI

    Motor de inferência de LLM em larga escala

    1.844+2Variação de estrelas nos últimos 7 dias
  • MTPLX@youssofal

    Velocidades 3x mais rápidas no MLX | Qwen 3.8 27B | Decodificação especulativa MTP nativa em Apple Silicon sem necessidade de rascunhador externo.

    1.805+235Variação de estrelas nos últimos 7 dias
  • xllm@xLLM-AI

    Um motor de inferência de alto desempenho para modelos LLM, VLM, DiT e REC, otimizado para diversos aceleradores de IA. É hospedado na OpenAtom Foundation.

    1.541+12Variação de estrelas nos últimos 7 dias
  • ai-hub-models@qualcomm

    Qualcomm® AI Hub Models é nossa coleção de modelos de aprendizado de máquina de última geração otimizados para desempenho (latência, memória, etc.) e prontos para implantação em dispositivos Qualcomm®.

    1.194+3Variação de estrelas nos últimos 7 dias
  • kvcached@ovg-project

    Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais

    1.145+5Variação de estrelas nos últimos 7 dias
  • Paddle.js@PaddlePaddle

    Paddle.js é um projeto web para o Baidu PaddlePaddle, um framework de deep learning de código aberto que roda no navegador. O Paddle.js pode carregar modelos pré-treinados ou converter modelos do paddle-hub usando suas ferramentas de conversão. Pode ser executado em qualquer navegador com suporte a WebGL/WebGPU/WebAssembly, além de Baidu Smartprogram e WX miniprogram.

    1.103+0Variação de estrelas nos últimos 7 dias
  • nobodywho@nobodywho-ooo

    NobodyWho é um mecanismo de inferência que permite executar LLMs localmente e de forma eficiente em qualquer dispositivo.

    1.081+11Variação de estrelas nos últimos 7 dias
  • mlxstudio@jjang-ai

    MLX Studio - Casa de JANG_Q - Geração/Edição de Imagem + Chat/Código Tudo em um - + OpenClaw (Anthropic API)

    960+11Variação de estrelas nos últimos 7 dias
  • ZhiLight@zhihu

    Um motor de aceleração de inferência de LLM altamente otimizado para Llama e suas variantes.

    908+0Variação de estrelas nos últimos 7 dias
  • Savant@insight-platform

    Framework Python de Visão Computacional e Análise de Vídeo pronto para uso

    849+1Variação de estrelas nos últimos 7 dias
  • pegainfer@pegainfer-project

    Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2

    660+4Variação de estrelas nos últimos 7 dias
  • mlx-dspark@ARahim3

    Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.

    624+98Variação de estrelas nos últimos 7 dias
  • yalm@andrewkchan

    Yet Another Language Model: inferência de LLM em C++/CUDA, sem bibliotecas além de I/O.

    597+1Variação de estrelas nos últimos 7 dias
  • astroid@pylint-dev

    Uma representação base comum de código-fonte Python para pylint e outros projetos

    582+1Variação de estrelas nos últimos 7 dias
  • KuiperLLama@zjhellofss

    Projeto para recrutamento e estágios, guiando você na implementação do zero de um framework de inferência de LLM com suporte a Llama2/3 e Qwen2.5.

    572+9Variação de estrelas nos últimos 7 dias
  • tessera@zengxiao-he

    From teacher to tiles — a from-scratch LLM distillation & serving engine: custom Triton/CUDA kernels, FSDP distillation, paged-KV continuous batching, speculative decoding, a Rust gateway, a JAX oracle, and interpretability tooling.

    552+35Variação de estrelas nos últimos 7 dias
  • krasis@brontoguana

    Krasis é um runtime LLM híbrido focado na execução eficiente de modelos maiores em hardware de nível de consumidor com VRAM limitada.

    516+3Variação de estrelas nos últimos 7 dias
  • OpenArc@SearchSavior

    Inference engine for Intel devices. Serve LLMs, VLMs, Whisper, Kokoro-TTS, Embedding and Rerank models over OpenAI endpoints.

    513+4Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos