llm-inference
Repositórios de código aberto acompanhados marcados com llm-inference, ordenados por estrelas.
- #31
Inferência de LLM distribuída. Conecte dispositivos domésticos em um cluster poderoso para acelerar a inferência de LLM. Mais dispositivos significam uma inferência mais rápida.
★ 3.050+4Variação de estrelas nos últimos 7 dias - #32
Medusa: Framework simples para acelerar a geração de LLM com múltiplas cabeças de decodificação
★ 2.771+0Variação de estrelas nos últimos 7 dias - #33
Implementação oficial do EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) e EAGLE-3 (NeurIPS'25).
★ 2.521+7Variação de estrelas nos últimos 7 dias - #34
Um agente de codificação aberto para seu terminal, construído por uma comunidade coletiva em vez de uma empresa. Traga seu próprio modelo, mantenha seu código em sua máquina e não deve nada a ninguém.
★ 2.439+41Variação de estrelas nos últimos 7 dias - #35
O framework agentic do ecossistema PHP para construir aplicações orientadas a IA prontas para produção. Conecte componentes (LLMs, ferramentas, bancos de dados vetoriais, memória) a agentes que interagem com seus dados e interface.
★ 2.086+21Variação de estrelas nos últimos 7 dias - #36★ 2.076+0Variação de estrelas nos últimos 7 dias
- #37
Execute qualquer Llama 2 localmente com interface gradio em GPU ou CPU de qualquer lugar (Linux/Windows/Mac). Use o `llama2-wrapper` como seu backend local do llama2 para Agentes/Aplicações Generativas.
★ 1.936-1Variação de estrelas nos últimos 7 dias - #38★ 1.764+4Variação de estrelas nos últimos 7 dias
- #39
Maneira declarativa de executar modelos de IA no React Native localmente, utilizando o ExecuTorch.
★ 1.707+5Variação de estrelas nos últimos 7 dias - #40
Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3
★ 1.613+33Variação de estrelas nos últimos 7 dias - #41
Um motor de inferência de alto desempenho para modelos LLM, VLM, DiT e REC, otimizado para diversos aceleradores de IA. É hospedado na OpenAtom Foundation.
★ 1.552+11Variação de estrelas nos últimos 7 dias - #42
A organização sem fins lucrativos que promove IA na Índia por meio de créditos, subsídios e recursos
★ 1.461+56Variação de estrelas nos últimos 7 dias - #43
Execute LLMs locais como llama, deepseek-distill, kokoro e outros dentro do seu navegador
★ 1.449+1Variação de estrelas nos últimos 7 dias - #44
Lista de softwares que permitem pesquisar na web com o auxílio de IA: https://hf.co/spaces/felladrin/awesome-ai-web-search
★ 1.426+3Variação de estrelas nos últimos 7 dias - #45
Aplicativo de IA local e motor de inferência para agentes. Execute LLMs de pesos abertos localmente — privado, 100% offline no seu computador. Entre no nosso Discord: https://discord.com/invite/8wGSsvmg4V
★ 1.413+20Variação de estrelas nos últimos 7 dias - #46
Repositório de "How To Scale Your Model", um livro didático em estilo de blog sobre o escalonamento de LLMs em TPUs
★ 1.396+12Variação de estrelas nos últimos 7 dias - #47
Uma coleção curada de ferramentas de teste de penetração de alto nível e utilitários de produtividade em vários domínios. Junte-se a nós para explorar, contribuir e aprimorar seu kit de ferramentas de hacking!
★ 1.383+1Variação de estrelas nos últimos 7 dias - #48
LLMs como copilotos para prova de teoremas em Lean
★ 1.318+1Variação de estrelas nos últimos 7 dias - #49
Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais
★ 1.275+130Variação de estrelas nos últimos 7 dias - #50
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.197+316Variação de estrelas nos últimos 7 dias - #51
Otimiza e simplifica o design de prompts para desenvolvedores e usuários não técnicos com uma abordagem low-code.
★ 1.154+0Variação de estrelas nos últimos 7 dias - #52
Construa seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão reduzida do vLLM.
★ 1.094+15Variação de estrelas nos últimos 7 dias - #53
OpenAlpha_Evolve é um framework Python open-source inspirado na pesquisa inovadora sobre agentes de codificação autônomos, como o AlphaEvolve da DeepMind.
★ 1.050+0Variação de estrelas nos últimos 7 dias - #54
O "AI-Compass" guiará a comunidade na navegação pelo oceano da tecnologia de IA; seja você um iniciante ou um desenvolvedor avançado, encontrará aqui o caminho para as principais direções da IA. O objetivo é ajudar os desenvolvedores a entender sistematicamente os conceitos principais de IA, tecnologias tradicionais, tendências de ponta e dominar todo o processo, da teoria à implementação prática, por meio da prática.
★ 933+10Variação de estrelas nos últimos 7 dias - #55
Lista de serviços de hospedagem organizados pelo preço do plano mínimo
★ 925+3Variação de estrelas nos últimos 7 dias - #56
Implementação em C++ puro de vários modelos para chat em tempo real no seu computador (CPU e GPU)
★ 924+3Variação de estrelas nos últimos 7 dias - #57
Um motor de aceleração de inferência de LLM altamente otimizado para Llama e suas variantes.
★ 908+0Variação de estrelas nos últimos 7 dias - #58
Notas sobre LLM, incluindo inferência de modelos, estrutura de modelos transformer e notas de análise de código de frameworks de LLM.
★ 889+1Variação de estrelas nos últimos 7 dias - #59
Um roteiro de 10 semanas, com 30 minutos por dia, para inferência e otimização de LLMs. vLLM, SGLang, quantização, decodificação especulativa, benchmarking.
★ 881+77Variação de estrelas nos últimos 7 dias - #60
LLM.swift é uma biblioteca simples e legível que permite interagir facilmente com grandes modelos de linguagem localmente em macOS, iOS, watchOS, tvOS e visionOS.
★ 874+3Variação de estrelas nos últimos 7 dias