llm-inference
Erfasste Open-Source-Repos mit dem Tag llm-inference, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit llm-inference am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit llm-inference getaggt wurden.
- #1
Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.
★ 7.195 - #2
Gemma 4 26B-A4B Inferenz in ca. 2 GB RAM auf jedem M-Series MacBook
★ 6.666 - #3
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.205 - #4
Ein 10-wöchiger, 30 Minuten pro Tag umfassender Fahrplan für LLM-Inferenz-Serving und -Optimierung. vLLM, SGLang, Quantisierung, spekulatives Decoding, Benchmarking.
★ 882 - #5
Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 645
- #1
GPT4All: Führe lokale LLM auf jedem Gerät aus. Open-source und für den kommerziellen Gebrauch verfügbar.
★ 77.387-9Sterne-Änderung der letzten 7 Tage - #2
Ray ist ein AI-Rechen-Engine. Ray besteht aus einem Core-Distributed-Runtime und einer Reihe von AI-Bibliotheken zur Beschleunigung von ML-Workloads.
★ 43.688+41Sterne-Änderung der letzten 7 Tage - #3★ 29.078+70Sterne-Änderung der letzten 7 Tage
- #4
Dieses Projekt zielt darauf ab, Prinzipien und praktische Erfahrungen zu großen Modellen zu teilen (großmodellengineering, großmodell-Anwendungen)
★ 24.995+21Sterne-Änderung der letzten 7 Tage - #5
Über 20 High-Performance-LLMs mit Rezepten zum Vortrainieren, Fine-Tunen und Skalieren.
★ 13.645+9Sterne-Änderung der letzten 7 Tage - #6
Führen Sie beliebige Open-Source-LLMs wie DeepSeek und Llama als OpenAI-kompatiblen API-Endpunkt in der Cloud aus.
★ 12.524+1Sterne-Änderung der letzten 7 Tage - #7
OpenVINO™ ist ein Open-Source-Toolkit zur Optimierung und Bereitstellung von KI-Inferenz
★ 10.793+30Sterne-Änderung der letzten 7 Tage - #8
High-Speed-LLM-Serving für die lokale Bereitstellung
★ 9.765+7Sterne-Änderung der letzten 7 Tage - #9
Der einfachste Weg, KI-Apps und -Modelle bereitzustellen – Erstellen Sie Modell-Inferenz-APIs, Job-artige Warteschlangen, LLM-Apps, Multi-Modell-Pipelines und mehr!
★ 8.817+4Sterne-Änderung der letzten 7 Tage - #10★ 8.041+8Sterne-Änderung der letzten 7 Tage
- #11★ 7.952+44Sterne-Änderung der letzten 7 Tage
- #12
Open-Source-Implementierung von AlphaEvolve
★ 7.307+22Sterne-Änderung der letzten 7 Tage - #13
Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.
★ 7.195+468Sterne-Änderung der letzten 7 Tage - #14
Plano ist ein KI-nativer Proxyserver und Data Plane für Agenten-Apps. Intelligentes LLM-Routing, Observability, Agenten-Orchestrierung und Guardrails, damit Sie sich auf die Kernlogik Ihrer Agenten konzentrieren können.
★ 7.033+11Sterne-Änderung der letzten 7 Tage - #15
Gemma 4 26B-A4B Inferenz in ca. 2 GB RAM auf jedem M-Series MacBook
★ 6.666+178Sterne-Änderung der letzten 7 Tage - #16
FlashInfer: Kernel-Bibliothek für LLM-Serving
★ 6.321+38Sterne-Änderung der letzten 7 Tage - #17
Quantisierung, Kernels, Laufzeit und Inferenz-Engine für Mobilgeräte, Wearables, Smart Home und Roboter.
★ 5.975+20Sterne-Änderung der letzten 7 Tage - #18
Standardisierte, verteilte generative und prädiktive KI-Inferenzplattform für skalierbare Bereitstellungen mit mehreren Frameworks auf Kubernetes
★ 5.853+13Sterne-Änderung der letzten 7 Tage - #19
⚡ Rein in Rust geschriebene WebGPU-Inferenz-Engine — OpenAI-API-kompatibel, GGUF-nativ, läuft auf jeder GPU. Kein Python. Kein llama.cpp. Einzelne Binärdatei.
★ 5.816+6Sterne-Änderung der letzten 7 Tage - #20
Ein GPU-Cluster-Manager für hochleistungsfähiges KI-Modell-Serving (vLLM, SGLang) und bedarfsgesteuerte GPU-Instanzen mit SSH-Zugang.
★ 5.593+21Sterne-Änderung der letzten 7 Tage - #21
Lemonade hilft Benutzern dabei, lokale KI-Apps zu entdecken und auszuführen, indem optimierte LLMs direkt von ihren eigenen GPUs und NPUs bereitgestellt werden. Treten Sie unserem Discord bei: https://discord.gg/5xXzkMu8Zk
★ 5.585+55Sterne-Änderung der letzten 7 Tage - #22
📚 Eine kuratierte Liste fantastischer LLM/VLM-Inferenz-Papers mit Code: Flash-Attention, Paged-Attention, WINT8/4, Parallelismus usw. 🎉
★ 5.482+3Sterne-Änderung der letzten 7 Tage - #23
Superduper: End-to-End-Framework zum Erstellen benutzerdefinierter KI-Anwendungen und Agents.
★ 5.318+1Sterne-Änderung der letzten 7 Tage - #24
Eko (Eko Keeps Operating) – Erstellen Sie produktionsreife agentenbasierte Workflows mit natürlicher Sprache – eko.fellou.ai
★ 4.954+2Sterne-Änderung der letzten 7 Tage - #25
RuVector ist eine in Rust geschriebene Hochleistungs-, Echtzeit-, selbstlernende KI, ein Vektor-GNN und eine In-Memory-Datenbank.
★ 4.473+6Sterne-Änderung der letzten 7 Tage - #26★ 4.260+3Sterne-Änderung der letzten 7 Tage
- #27
Generative KI-Referenz-Workflows, optimiert für beschleunigte Infrastruktur und Mikroservice-Architektur.
★ 4.169+4Sterne-Änderung der letzten 7 Tage - #28★ 3.827+1Sterne-Änderung der letzten 7 Tage
- #29
Eine Sammlung wissenschaftlicher Methoden, Prozesse, Algorithmen und Systeme zum Erstellen von Geschichten und Modellen.
★ 3.676+2Sterne-Änderung der letzten 7 Tage - #30
Fügen Sie Ihrer operativen Datenbank einen Echtzeit-Analyse-Knoten hinzu. Spice ist eine portable, beschleunigte SQL-Abfrage-, Such- und LLM-Inferenz-Engine in Rust für datengestützte KI-Apps und Agenten.
★ 3.075+1Sterne-Änderung der letzten 7 Tage