llm-inference
Repositórios de código aberto acompanhados marcados com llm-inference, ordenados por estrelas.
- #61
Inferência do Llama 3+ em puro Java
★ 816+0Variação de estrelas nos últimos 7 dias - #62
LeaderWorkerSet: Uma API para implantar um grupo de pods como uma unidade de replicação
★ 808+7Variação de estrelas nos últimos 7 dias - #63LLM-PowerHouse-A-Curated-Guide-for-Large-Language-Models-with-Custom-Training-and-Inferencing↗@ghimiresunil
LLM-PowerHouse: Libere o potencial de LLMs por meio de tutoriais selecionados, melhores práticas e código pronto para uso para treinamento e inferência personalizados.
★ 731+0Variação de estrelas nos últimos 7 dias - #64★ 707+0Variação de estrelas nos últimos 7 dias
- #65
USP: Unified (também conhecido como Hybrid, 2D) Sequence Parallel Attention para treinamento e inferência de modelos Transformers de contexto longo
★ 691+3Variação de estrelas nos últimos 7 dias - #66
Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2
★ 677+18Variação de estrelas nos últimos 7 dias - #67★ 675+3Variação de estrelas nos últimos 7 dias
- #68
Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.
★ 640+25Variação de estrelas nos últimos 7 dias - #69★ 608+45Variação de estrelas nos últimos 7 dias
- #70
Alternativa ao Ollama para NPU Rockchip: Uma solução eficiente para executar modelos de IA e aprendizado profundo em dispositivos Rockchip com suporte otimizado a NPU (rkllm)
★ 600+4Variação de estrelas nos últimos 7 dias - #71
Yet Another Language Model: inferência de LLM em C++/CUDA, sem bibliotecas além de I/O.
★ 596-1Variação de estrelas nos últimos 7 dias - #72
SDK de IA local open-source - execute IA no dispositivo sem nuvem e sem chaves de API. Suporta GGUF, RAG, geração de imagem, música e vídeo, conversão de fala em texto, inferência P2P e muito mais. Multiplataforma: Linux, macOS, Windows, Android, iOS.
★ 589+33Variação de estrelas nos últimos 7 dias - #73
Plataforma minimalista de busca na web com um assistente de IA executado diretamente no seu navegador. Demo: https://felladrin-minisearch.hf.space
★ 585+0Variação de estrelas nos últimos 7 dias - #74
CLI para executar um grande número de agentes de codificação em paralelo com git worktrees
★ 582+0Variação de estrelas nos últimos 7 dias - #75
Fine-tuning de LLM (Large Language Model)
★ 579+1Variação de estrelas nos últimos 7 dias - #76★ 578+8Variação de estrelas nos últimos 7 dias
- #77
Projeto para recrutamento e estágios, guiando você na implementação do zero de um framework de inferência de LLM com suporte a Llama2/3 e Qwen2.5.
★ 573+1Variação de estrelas nos últimos 7 dias - #78
Mini motor de inferência estático e suckless para qwen3-0.6B, lote único (single batch) e exclusivo para CUDA.
★ 559+0Variação de estrelas nos últimos 7 dias - #79
Um mecanismo de atendimento de baixa latência e alto rendimento para LLMs
★ 520+0Variação de estrelas nos últimos 7 dias - #80
Krasis é um runtime LLM híbrido focado na execução eficiente de modelos maiores em hardware de nível de consumidor com VRAM limitada.
★ 519+2Variação de estrelas nos últimos 7 dias - #81
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 519+14Variação de estrelas nos últimos 7 dias - #82
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 507—Variação de estrelas nos últimos 7 dias - #83★ 505-1Variação de estrelas nos últimos 7 dias