inference-engine
Erfasste Open-Source-Repos mit dem Tag inference-engine, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit inference-engine am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit inference-engine getaggt wurden.
- #1
Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.
★ 6.926 - #2
Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 628 - #3
Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.
★ 559
- #1
✍🏻 Quellcode-Analysen, Systemdesign & Engineering-Blogs | Halfrost-Field: Notizen zu Quellcode-Analyse, Systemdesign und Engineering-Praxis
★ 13.220+3Sterne-Änderung der letzten 7 Tage - #2
Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.
★ 6.926+485Sterne-Änderung der letzten 7 Tage - #3
FEDML - Die vereinheitlichte und skalierbare ML-Bibliothek für verteiltes Training im großen Maßstab, Modellbereitstellung und föderiertes Lernen. FEDML Launch, ein Cloud-übergreifender Scheduler, ermöglicht zudem die Ausführung beliebiger KI-Jobs auf jeder GPU-Cloud oder jedem On-Premise-Cluster. Basierend auf dieser Bibliothek ist TensorOpera AI (https://TensorOpera.ai) Ihre generative KI-Plattform im großen Maßstab.
★ 4.061-1Sterne-Änderung der letzten 7 Tage - #4
Implementiere Schritt für Schritt eine hochleistungsfähige Deep-Learning-Inferenzbibliothek, die Modelle wie Llama2, Unet, Yolov5, Resnet und andere unterstützt.
★ 3.497+1Sterne-Änderung der letzten 7 Tage - #5
Regel-Engine-Implementierung in Golang
★ 2.522+0Sterne-Änderung der letzten 7 Tage - #6
OneDiff: Eine sofort einsatzbereite Beschleunigungsbibliothek für Diffusionsmodelle.
★ 1.964+1Sterne-Änderung der letzten 7 Tage - #7★ 1.844+2Sterne-Änderung der letzten 7 Tage
- #8
3x schnellere Geschwindigkeiten auf MLX | Qwen 3.8 27B | Natives MTP Speculative Decoding auf Apple Silicon ohne externen Drafter.
★ 1.805+235Sterne-Änderung der letzten 7 Tage - #9
Eine hochleistungsfähige Inferenz-Engine für LLM-, VLM-, DiT- und REC-Modelle, optimiert für verschiedene KI-Beschleuniger. Gehostet von der OpenAtom Foundation.
★ 1.541+12Sterne-Änderung der letzten 7 Tage - #10
Qualcomm® AI Hub Models ist unsere Sammlung hochmoderner Modelle für maschinelles Lernen, die auf Leistung (Latenz, Speicher usw.) optimiert und bereit für die Bereitstellung auf Qualcomm®-Geräten sind.
★ 1.195+3Sterne-Änderung der letzten 7 Tage - #11★ 1.192+5Sterne-Änderung der letzten 7 Tage
- #12
Paddle.js ist ein Webprojekt für Baidu PaddlePaddle, ein Open-Source-Deep-Learning-Framework, das im Browser läuft. Paddle.js kann entweder ein vortrainiertes Modell laden oder mit den bereitgestellten Transformations-Tools ein Modell aus Paddle-Hub umwandeln. Es läuft in jedem Browser mit WebGL/WebGPU/WebAssembly-Unterstützung sowie in Baidu Smartprogram und WX-Miniprogrammen.
★ 1.104+0Sterne-Änderung der letzten 7 Tage - #13
NobodyWho ist eine Inferenz-Engine, mit der Sie LLMs lokal und effizient auf jedem Gerät ausführen können.
★ 1.081+11Sterne-Änderung der letzten 7 Tage - #14
MLX Studio - Heimat von JANG_Q - Bilderzeugung/bearbeitung + Chat/Code Alles in einem - + OpenClaw (Anthropic API)
★ 961+11Sterne-Änderung der letzten 7 Tage - #15
Eine hochoptimierte LLM-Inferenz-Beschleunigungs-Engine für Llama und dessen Varianten.
★ 908+0Sterne-Änderung der letzten 7 Tage - #16
Python Computer Vision- & Video-Analytics-Framework mitgeliefert mit allem Drum und Dran
★ 850+1Sterne-Änderung der letzten 7 Tage - #17
Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2
★ 667+4Sterne-Änderung der letzten 7 Tage - #18
Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 628+98Sterne-Änderung der letzten 7 Tage - #19
Yet Another Language Model: LLM-Inferenz in C++/CUDA, ohne externe Bibliotheken außer für I/O.
★ 596+1Sterne-Änderung der letzten 7 Tage - #20
Eine gemeinsame Basisrepräsentation von Python-Quellcode für pylint und andere Projekte
★ 582+1Sterne-Änderung der letzten 7 Tage - #21
Ein Projekt für Praktika und Berufseinstieg, das Sie Schritt für Schritt bei der Implementierung eines LLM-Inferenz-Frameworks mit Unterstützung für Llama2/3 und Qwen2.5 anleitet.
★ 572+9Sterne-Änderung der letzten 7 Tage - #22
Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.
★ 559+35Sterne-Änderung der letzten 7 Tage - #23
Krasis ist eine hybride LLM-Laufzeitumgebung, die auf den effizienten Betrieb größerer Modelle auf Hardware mit begrenztem VRAM für Endverbraucher spezialisiert ist.
★ 516+3Sterne-Änderung der letzten 7 Tage - #24
Inferenz-Engine für Intel-Geräte. Bereitstellung von LLMs, VLMs, Whisper, Kokoro-TTS, Embedding- und Rerank-Modellen über OpenAI-Endpunkte.
★ 512+4Sterne-Änderung der letzten 7 Tage