Pular para o conteúdo principal
buildradar
Sign in
Tópico · llm-inference

llm-inference

Repositórios de código aberto acompanhados marcados com llm-inference, ordenados por estrelas.

83 repositórios
  • llama3.java@mukel

    Inferência do Llama 3+ em puro Java

    816+0Variação de estrelas nos últimos 7 dias
  • lws@kubernetes-sigs

    LeaderWorkerSet: Uma API para implantar um grupo de pods como uma unidade de replicação

    808+7Variação de estrelas nos últimos 7 dias
  • LLM-PowerHouse: Libere o potencial de LLMs por meio de tutoriais selecionados, melhores práticas e código pronto para uso para treinamento e inferência personalizados.

    731+0Variação de estrelas nos últimos 7 dias
  • llmflows@stoyan-stoyanov

    LLMFlows - Aplicativos LLM simples, explícitos e transparentes

    707+0Variação de estrelas nos últimos 7 dias
  • long-context-attention@feifeibear

    USP: Unified (também conhecido como Hybrid, 2D) Sequence Parallel Attention para treinamento e inferência de modelos Transformers de contexto longo

    691+3Variação de estrelas nos últimos 7 dias
  • pegainfer@pegainfer-project

    Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2

    677+18Variação de estrelas nos últimos 7 dias
  • atlas@Avarok-Cybersecurity

    Motor de inferência puro em Rust

    675+3Variação de estrelas nos últimos 7 dias
  • mlx-dspark@ARahim3

    Decodificação de LLM até 4x mais rápida no Apple Silicon, sem perdas. Port nativo em MLX do DSpark da DeepSeek e da decodificação especulativa DFlash do z-lab — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, Bonsai-27B ternário.

    640+25Variação de estrelas nos últimos 7 dias
  • hipfire@warpfront

    Motor de inferência de LLM nativo para RDNA escrito em Rust.

    608+45Variação de estrelas nos últimos 7 dias
  • rkllama@NotPunchnox

    Alternativa ao Ollama para NPU Rockchip: Uma solução eficiente para executar modelos de IA e aprendizado profundo em dispositivos Rockchip com suporte otimizado a NPU (rkllm)

    600+4Variação de estrelas nos últimos 7 dias
  • yalm@andrewkchan

    Yet Another Language Model: inferência de LLM em C++/CUDA, sem bibliotecas além de I/O.

    596-1Variação de estrelas nos últimos 7 dias
  • qvac@tetherto

    SDK de IA local open-source - execute IA no dispositivo sem nuvem e sem chaves de API. Suporta GGUF, RAG, geração de imagem, música e vídeo, conversão de fala em texto, inferência P2P e muito mais. Multiplataforma: Linux, macOS, Windows, Android, iOS.

    589+33Variação de estrelas nos últimos 7 dias
  • MiniSearch@felladrin

    Plataforma minimalista de busca na web com um assistente de IA executado diretamente no seu navegador. Demo: https://felladrin-minisearch.hf.space

    585+0Variação de estrelas nos últimos 7 dias
  • uzi@devflowinc

    CLI para executar um grande número de agentes de codificação em paralelo com git worktrees

    582+0Variação de estrelas nos últimos 7 dias
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    Fine-tuning de LLM (Large Language Model)

    579+1Variação de estrelas nos últimos 7 dias
  • LLM-Hub@timmyy123

    Assistente de IA local

    578+8Variação de estrelas nos últimos 7 dias
  • KuiperLLama@zjhellofss

    Projeto para recrutamento e estágios, guiando você na implementação do zero de um framework de inferência de LLM com suporte a Llama2/3 e Qwen2.5.

    573+1Variação de estrelas nos últimos 7 dias
  • qwen600@yassa9

    Mini motor de inferência estático e suckless para qwen3-0.6B, lote único (single batch) e exclusivo para CUDA.

    559+0Variação de estrelas nos últimos 7 dias
  • sarathi-serve@microsoft

    Um mecanismo de atendimento de baixa latência e alto rendimento para LLMs

    520+0Variação de estrelas nos últimos 7 dias
  • krasis@brontoguana

    Krasis é um runtime LLM híbrido focado na execução eficiente de modelos maiores em hardware de nível de consumidor com VRAM limitada.

    519+2Variação de estrelas nos últimos 7 dias
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    519+14Variação de estrelas nos últimos 7 dias
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    507Variação de estrelas nos últimos 7 dias
  • vllm-cli@Chen-zexi

    Uma ferramenta de interface de linha de comando para servir LLM usando vLLM.

    505-1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos