llm-inference
Erfasste Open-Source-Repos mit dem Tag llm-inference, sortiert nach Sternen.
- #61
Llama-3+-Inferenz in reinem Java
★ 816+0Sterne-Änderung der letzten 7 Tage - #62
LeaderWorkerSet: Eine API zur Bereitstellung einer Gruppe von Pods als Replikationseinheit
★ 810+8Sterne-Änderung der letzten 7 Tage - #63LLM-PowerHouse-A-Curated-Guide-for-Large-Language-Models-with-Custom-Training-and-Inferencing↗@ghimiresunil
LLM-PowerHouse: Schöpfen Sie das Potenzial von LLMs durch kuratierte Tutorials, Best Practices und sofort einsatzbereiten Code für benutzerdefiniertes Training und Inferenz voll aus.
★ 731+0Sterne-Änderung der letzten 7 Tage - #64★ 707+0Sterne-Änderung der letzten 7 Tage
- #65
USP: Unified (bzw. Hybrid, 2D) Sequence Parallel Attention für das Training und die Inferenz von Long-Context-Transformer-Modellen
★ 692+3Sterne-Änderung der letzten 7 Tage - #66
Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2
★ 678+17Sterne-Änderung der letzten 7 Tage - #67★ 677+4Sterne-Änderung der letzten 7 Tage
- #68
Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 645+30Sterne-Änderung der letzten 7 Tage - #69★ 613+46Sterne-Änderung der letzten 7 Tage
- #70
Ollama-Alternative für Rockchip NPU: Eine effiziente Lösung zum Ausführen von KI- und Deep-Learning-Modellen auf Rockchip-Geräten mit optimierter NPU-Unterstützung (rkllm)
★ 602+5Sterne-Änderung der letzten 7 Tage - #71
面向大模型开发者的 SGLang 系统化开源教程:从推理基础与环境搭建开始,逐步学习模型部署、结构化生成、服务开发和性能优化, 结合实战案例带你从 0 到 1 掌握 SGLang,构建高性能 LLM 推理应用
★ 601—Sterne-Änderung der letzten 7 Tage - #72
Yet Another Language Model: LLM-Inferenz in C++/CUDA, ohne externe Bibliotheken außer für I/O.
★ 596-1Sterne-Änderung der letzten 7 Tage - #73
Open-Source-lokales KI-SDK – Führen Sie KI geräteintern ohne Cloud, ohne API-Schlüssel aus. Unterstützt GGUF, RAG, Bild-, Musik- und Videoerstellung, Sprache-zu-Text, P2P-Inferenz und mehr. Plattformübergreifend: Linux, macOS, Windows, Android, iOS.
★ 594+35Sterne-Änderung der letzten 7 Tage - #74
Minimalistische Websuchplattform mit einem KI-Assistenten, der direkt im Browser läuft. Demo: https://felladrin-minisearch.hf.space
★ 585+0Sterne-Änderung der letzten 7 Tage - #75★ 582+0Sterne-Änderung der letzten 7 Tage
- #76★ 580+9Sterne-Änderung der letzten 7 Tage
- #77
LLM (Large Language Model) Fine-Tuning.
★ 579+1Sterne-Änderung der letzten 7 Tage - #78
Ein Projekt für Praktika und Berufseinstieg, das Sie Schritt für Schritt bei der Implementierung eines LLM-Inferenz-Frameworks mit Unterstützung für Llama2/3 und Qwen2.5 anleitet.
★ 573+1Sterne-Änderung der letzten 7 Tage - #79
Statische, minimalistische Single-Batch-Inferenz-Engine für qwen3-0.6B, ausschließlich für CUDA
★ 559+0Sterne-Änderung der letzten 7 Tage - #80
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 521+17Sterne-Änderung der letzten 7 Tage - #81
Eine Serving-Engine mit niedriger Latenz und hohem Durchsatz für LLMs
★ 521+0Sterne-Änderung der letzten 7 Tage - #82
Krasis ist eine hybride LLM-Laufzeitumgebung, die auf den effizienten Betrieb größerer Modelle auf Hardware mit begrenztem VRAM für Endverbraucher spezialisiert ist.
★ 519+3Sterne-Änderung der letzten 7 Tage - #83
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 507—Sterne-Änderung der letzten 7 Tage - #84★ 505-1Sterne-Änderung der letzten 7 Tage