Pular para o conteúdo principal
buildradar
Sign in
Tópico · llm-inference

llm-inference

Repositórios de código aberto acompanhados marcados com llm-inference, ordenados por estrelas.

83 repositórios
  • Inferência de LLM distribuída. Conecte dispositivos domésticos em um cluster poderoso para acelerar a inferência de LLM. Mais dispositivos significam uma inferência mais rápida.

    3.050+4Variação de estrelas nos últimos 7 dias
  • Medusa@FasterDecoding

    Medusa: Framework simples para acelerar a geração de LLM com múltiplas cabeças de decodificação

    2.771+0Variação de estrelas nos últimos 7 dias
  • EAGLE@SafeAILab

    Implementação oficial do EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) e EAGLE-3 (NeurIPS'25).

    2.521+7Variação de estrelas nos últimos 7 dias
  • nanocoder@Nano-Collective

    Um agente de codificação aberto para seu terminal, construído por uma comunidade coletiva em vez de uma empresa. Traga seu próprio modelo, mantenha seu código em sua máquina e não deve nada a ninguém.

    2.439+41Variação de estrelas nos últimos 7 dias
  • neuron-ai@neuron-core

    O framework agentic do ecossistema PHP para construir aplicações orientadas a IA prontas para produção. Conecte componentes (LLMs, ferramentas, bancos de dados vetoriais, memória) a agentes que interagem com seus dados e interface.

    2.086+21Variação de estrelas nos últimos 7 dias
  • aici@microsoft

    AICI: Prompts como Programas (Wasm)

    2.076+0Variação de estrelas nos últimos 7 dias
  • llama2-webui@liltom-eth

    Execute qualquer Llama 2 localmente com interface gradio em GPU ou CPU de qualquer lugar (Linux/Windows/Mac). Use o `llama2-wrapper` como seu backend local do llama2 para Agentes/Aplicações Generativas.

    1.936-1Variação de estrelas nos últimos 7 dias
  • beta9@beam-cloud

    Inferência de GPU serverless ultrarrápida, sandboxes e tarefas em segundo plano

    1.764+4Variação de estrelas nos últimos 7 dias
  • react-native-executorch@software-mansion

    Maneira declarativa de executar modelos de IA no React Native localmente, utilizando o ExecuTorch.

    1.707+5Variação de estrelas nos últimos 7 dias
  • InferenceX@SemiAnalysisAI

    Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3

    1.613+33Variação de estrelas nos últimos 7 dias
  • xllm@xLLM-AI

    Um motor de inferência de alto desempenho para modelos LLM, VLM, DiT e REC, otimizado para diversos aceleradores de IA. É hospedado na OpenAtom Foundation.

    1.552+11Variação de estrelas nos últimos 7 dias
  • aigrantsindia@aigrantsindia

    A organização sem fins lucrativos que promove IA na Índia por meio de créditos, subsídios e recursos

    1.461+56Variação de estrelas nos últimos 7 dias
  • BrowserAI@sauravpanda

    Execute LLMs locais como llama, deepseek-distill, kokoro e outros dentro do seu navegador

    1.449+1Variação de estrelas nos últimos 7 dias
  • Lista de softwares que permitem pesquisar na web com o auxílio de IA: https://hf.co/spaces/felladrin/awesome-ai-web-search

    1.426+3Variação de estrelas nos últimos 7 dias
  • Atomic-Chat@AtomicBot-ai

    Aplicativo de IA local e motor de inferência para agentes. Execute LLMs de pesos abertos localmente — privado, 100% offline no seu computador. Entre no nosso Discord: https://discord.com/invite/8wGSsvmg4V

    1.413+20Variação de estrelas nos últimos 7 dias
  • scaling-book@jax-ml

    Repositório de "How To Scale Your Model", um livro didático em estilo de blog sobre o escalonamento de LLMs em TPUs

    1.396+12Variação de estrelas nos últimos 7 dias
  • Uma coleção curada de ferramentas de teste de penetração de alto nível e utilitários de produtividade em vários domínios. Junte-se a nós para explorar, contribuir e aprimorar seu kit de ferramentas de hacking!

    1.383+1Variação de estrelas nos últimos 7 dias
  • LeanCopilot@lean-dojo

    LLMs como copilotos para prova de teoremas em Lean

    1.318+1Variação de estrelas nos últimos 7 dias
  • kvcached@ovg-project

    Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais

    1.275+130Variação de estrelas nos últimos 7 dias
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.197+316Variação de estrelas nos últimos 7 dias
  • prompt-poet@character-ai

    Otimiza e simplifica o design de prompts para desenvolvedores e usuários não técnicos com uma abordagem low-code.

    1.154+0Variação de estrelas nos últimos 7 dias
  • tiny-vllm@jmaczan

    Construa seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão reduzida do vLLM.

    1.094+15Variação de estrelas nos últimos 7 dias
  • OpenAlpha_Evolve@shyamsaktawat

    OpenAlpha_Evolve é um framework Python open-source inspirado na pesquisa inovadora sobre agentes de codificação autônomos, como o AlphaEvolve da DeepMind.

    1.050+0Variação de estrelas nos últimos 7 dias
  • AI-Compass@tingaicompass

    O "AI-Compass" guiará a comunidade na navegação pelo oceano da tecnologia de IA; seja você um iniciante ou um desenvolvedor avançado, encontrará aqui o caminho para as principais direções da IA. O objetivo é ajudar os desenvolvedores a entender sistematicamente os conceitos principais de IA, tecnologias tradicionais, tendências de ponta e dominar todo o processo, da teoria à implementação prática, por meio da prática.

    933+10Variação de estrelas nos últimos 7 dias
  • Lista de serviços de hospedagem organizados pelo preço do plano mínimo

    925+3Variação de estrelas nos últimos 7 dias
  • Implementação em C++ puro de vários modelos para chat em tempo real no seu computador (CPU e GPU)

    924+3Variação de estrelas nos últimos 7 dias
  • ZhiLight@zhihu

    Um motor de aceleração de inferência de LLM altamente otimizado para Llama e suas variantes.

    908+0Variação de estrelas nos últimos 7 dias
  • llm_note@harleyszhang

    Notas sobre LLM, incluindo inferência de modelos, estrutura de modelos transformer e notas de análise de código de frameworks de LLM.

    889+1Variação de estrelas nos últimos 7 dias
  • Um roteiro de 10 semanas, com 30 minutos por dia, para inferência e otimização de LLMs. vLLM, SGLang, quantização, decodificação especulativa, benchmarking.

    881+77Variação de estrelas nos últimos 7 dias
  • LLM.swift@eastriverlee

    LLM.swift é uma biblioteca simples e legível que permite interagir facilmente com grandes modelos de linguagem localmente em macOS, iOS, watchOS, tvOS e visionOS.

    874+3Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos