Zum Hauptinhalt springen
buildradar
Sign in
Thema · inference-engine

inference-engine

Erfasste Open-Source-Repos mit dem Tag inference-engine, sortiert nach Sternen.

Repos
24
Sterne gesamt
48.964
Sterne im Schnitt
2.040
Anteil
0,00%

Themen, die häufig gemeinsam mit inference-engine am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit inference-engine getaggt wurden.

  • kimi-k3-in-c@FareedKhan-dev

    Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.

    6.926
  • mlx-dspark@ARahim3

    Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    628
  • tessera@zengxiao-he

    Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.

    559
  • ✍🏻 Quellcode-Analysen, Systemdesign & Engineering-Blogs | Halfrost-Field: Notizen zu Quellcode-Analyse, Systemdesign und Engineering-Praxis

    13.220+3Sterne-Änderung der letzten 7 Tage
  • kimi-k3-in-c@FareedKhan-dev

    Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.

    6.926+485Sterne-Änderung der letzten 7 Tage
  • FedML@FedML-AI

    FEDML - Die vereinheitlichte und skalierbare ML-Bibliothek für verteiltes Training im großen Maßstab, Modellbereitstellung und föderiertes Lernen. FEDML Launch, ein Cloud-übergreifender Scheduler, ermöglicht zudem die Ausführung beliebiger KI-Jobs auf jeder GPU-Cloud oder jedem On-Premise-Cluster. Basierend auf dieser Bibliothek ist TensorOpera AI (https://TensorOpera.ai) Ihre generative KI-Plattform im großen Maßstab.

    4.061-1Sterne-Änderung der letzten 7 Tage
  • KuiperInfer@zjhellofss

    Implementiere Schritt für Schritt eine hochleistungsfähige Deep-Learning-Inferenzbibliothek, die Modelle wie Llama2, Unet, Yolov5, Resnet und andere unterstützt.

    3.497+1Sterne-Änderung der letzten 7 Tage
  • grule-rule-engine@hyperjumptech

    Regel-Engine-Implementierung in Golang

    2.522+0Sterne-Änderung der letzten 7 Tage
  • onediff@siliconflow

    OneDiff: Eine sofort einsatzbereite Beschleunigungsbibliothek für Diffusionsmodelle.

    1.964+1Sterne-Änderung der letzten 7 Tage
  • sonar@dphnAI

    Skalierbare LLM-Inferenz-Engine

    1.844+2Sterne-Änderung der letzten 7 Tage
  • MTPLX@youssofal

    3x schnellere Geschwindigkeiten auf MLX | Qwen 3.8 27B | Natives MTP Speculative Decoding auf Apple Silicon ohne externen Drafter.

    1.805+235Sterne-Änderung der letzten 7 Tage
  • xllm@xLLM-AI

    Eine hochleistungsfähige Inferenz-Engine für LLM-, VLM-, DiT- und REC-Modelle, optimiert für verschiedene KI-Beschleuniger. Gehostet von der OpenAtom Foundation.

    1.541+12Sterne-Änderung der letzten 7 Tage
  • ai-hub-models@qualcomm

    Qualcomm® AI Hub Models ist unsere Sammlung hochmoderner Modelle für maschinelles Lernen, die auf Leistung (Latenz, Speicher usw.) optimiert und bereit für die Bereitstellung auf Qualcomm®-Geräten sind.

    1.195+3Sterne-Änderung der letzten 7 Tage
  • kvcached@ovg-project

    Virtualisierter Elastic KV Cache für dynamisches GPU-Sharing und mehr

    1.192+5Sterne-Änderung der letzten 7 Tage
  • Paddle.js@PaddlePaddle

    Paddle.js ist ein Webprojekt für Baidu PaddlePaddle, ein Open-Source-Deep-Learning-Framework, das im Browser läuft. Paddle.js kann entweder ein vortrainiertes Modell laden oder mit den bereitgestellten Transformations-Tools ein Modell aus Paddle-Hub umwandeln. Es läuft in jedem Browser mit WebGL/WebGPU/WebAssembly-Unterstützung sowie in Baidu Smartprogram und WX-Miniprogrammen.

    1.104+0Sterne-Änderung der letzten 7 Tage
  • nobodywho@nobodywho-ooo

    NobodyWho ist eine Inferenz-Engine, mit der Sie LLMs lokal und effizient auf jedem Gerät ausführen können.

    1.081+11Sterne-Änderung der letzten 7 Tage
  • mlxstudio@jjang-ai

    MLX Studio - Heimat von JANG_Q - Bilderzeugung/bearbeitung + Chat/Code Alles in einem - + OpenClaw (Anthropic API)

    961+11Sterne-Änderung der letzten 7 Tage
  • ZhiLight@zhihu

    Eine hochoptimierte LLM-Inferenz-Beschleunigungs-Engine für Llama und dessen Varianten.

    908+0Sterne-Änderung der letzten 7 Tage
  • Savant@insight-platform

    Python Computer Vision- & Video-Analytics-Framework mitgeliefert mit allem Drum und Dran

    850+1Sterne-Änderung der letzten 7 Tage
  • pegainfer@pegainfer-project

    Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2

    667+4Sterne-Änderung der letzten 7 Tage
  • mlx-dspark@ARahim3

    Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    628+98Sterne-Änderung der letzten 7 Tage
  • yalm@andrewkchan

    Yet Another Language Model: LLM-Inferenz in C++/CUDA, ohne externe Bibliotheken außer für I/O.

    596+1Sterne-Änderung der letzten 7 Tage
  • astroid@pylint-dev

    Eine gemeinsame Basisrepräsentation von Python-Quellcode für pylint und andere Projekte

    582+1Sterne-Änderung der letzten 7 Tage
  • KuiperLLama@zjhellofss

    Ein Projekt für Praktika und Berufseinstieg, das Sie Schritt für Schritt bei der Implementierung eines LLM-Inferenz-Frameworks mit Unterstützung für Llama2/3 und Qwen2.5 anleitet.

    572+9Sterne-Änderung der letzten 7 Tage
  • tessera@zengxiao-he

    Vom Lehrer zu den Kacheln – eine von Grund auf neu entwickelte LLM-Destillations- und Serving-Engine: mit benutzerdefinierten Triton/CUDA-Kernels, FSDP-Destillation, Paged-KV Continuous Batching, spekulativem Decoding, einem Rust-Gateway, einem JAX-Oracle und Tools zur Interpretierbarkeit.

    559+35Sterne-Änderung der letzten 7 Tage
  • krasis@brontoguana

    Krasis ist eine hybride LLM-Laufzeitumgebung, die auf den effizienten Betrieb größerer Modelle auf Hardware mit begrenztem VRAM für Endverbraucher spezialisiert ist.

    516+3Sterne-Änderung der letzten 7 Tage
  • OpenArc@SearchSavior

    Inferenz-Engine für Intel-Geräte. Bereitstellung von LLMs, VLMs, Whisper, Kokoro-TTS, Embedding- und Rerank-Modellen über OpenAI-Endpunkte.

    512+4Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen