Zum Hauptinhalt springen
buildradar
Sign in
Thema · llm-inference

llm-inference

Erfasste Open-Source-Repos mit dem Tag llm-inference, sortiert nach Sternen.

Repos
83
Sterne gesamt
408.416
Sterne im Schnitt
4.921
Anteil
0,02%

Themen, die häufig gemeinsam mit llm-inference am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit llm-inference getaggt wurden.

  • kimi-k3-in-c@FareedKhan-dev

    Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.

    7.195
  • turbo-fieldfare@drumih

    Gemma 4 26B-A4B Inferenz in ca. 2 GB RAM auf jedem M-Series MacBook

    6.666
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.205
  • Ein 10-wöchiger, 30 Minuten pro Tag umfassender Fahrplan für LLM-Inferenz-Serving und -Optimierung. vLLM, SGLang, Quantisierung, spekulatives Decoding, Benchmarking.

    882
  • mlx-dspark@ARahim3

    Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    645
  • gpt4all@nomic-ai

    GPT4All: Führe lokale LLM auf jedem Gerät aus. Open-source und für den kommerziellen Gebrauch verfügbar.

    77.387-9Sterne-Änderung der letzten 7 Tage
  • ray@ray-project

    Ray ist ein AI-Rechen-Engine. Ray besteht aus einem Core-Distributed-Runtime und einer Reihe von AI-Bibliotheken zur Beschleunigung von ML-Workloads.

    43.688+41Sterne-Änderung der letzten 7 Tage
  • gitleaks@gitleaks

    Finde Geheimnisse mit Gitleaks 🔑

    29.078+70Sterne-Änderung der letzten 7 Tage
  • llm-action@liguodongiot

    Dieses Projekt zielt darauf ab, Prinzipien und praktische Erfahrungen zu großen Modellen zu teilen (großmodellengineering, großmodell-Anwendungen)

    24.995+21Sterne-Änderung der letzten 7 Tage
  • litgpt@Lightning-AI

    Über 20 High-Performance-LLMs mit Rezepten zum Vortrainieren, Fine-Tunen und Skalieren.

    13.645+9Sterne-Änderung der letzten 7 Tage
  • OpenLLM@bentoml

    Führen Sie beliebige Open-Source-LLMs wie DeepSeek und Llama als OpenAI-kompatiblen API-Endpunkt in der Cloud aus.

    12.524+1Sterne-Änderung der letzten 7 Tage
  • openvino@openvinotoolkit

    OpenVINO™ ist ein Open-Source-Toolkit zur Optimierung und Bereitstellung von KI-Inferenz

    10.793+30Sterne-Änderung der letzten 7 Tage
  • PowerInfer@Tiiny-AI

    High-Speed-LLM-Serving für die lokale Bereitstellung

    9.765+7Sterne-Änderung der letzten 7 Tage
  • BentoML@bentoml

    Der einfachste Weg, KI-Apps und -Modelle bereitzustellen – Erstellen Sie Modell-Inferenz-APIs, Job-artige Warteschlangen, LLM-Apps, Multi-Modell-Pipelines und mehr!

    8.817+4Sterne-Änderung der letzten 7 Tage
  • lmdeploy@InternLM

    LMDeploy ist ein Toolkit zum Komprimieren, Bereitstellen und Ausführen von LLMs.

    8.041+8Sterne-Änderung der letzten 7 Tage
  • dynamo@ai-dynamo

    Ein verteiltes Inference-Serving-Framework auf Rechenzentrumsebene

    7.952+44Sterne-Änderung der letzten 7 Tage
  • openevolve@algorithmicsuperintelligence

    Open-Source-Implementierung von AlphaEvolve

    7.307+22Sterne-Änderung der letzten 7 Tage
  • kimi-k3-in-c@FareedKhan-dev

    Ein 2,78-Billionen-Parameter-Modell Kimi K3, das Inferenz auf einer einzigen CPU in 8,24 GB RAM ausführt. Tragbares C99: kein BLAS, kein Framework, keine GPU.

    7.195+468Sterne-Änderung der letzten 7 Tage
  • plano@katanemo

    Plano ist ein KI-nativer Proxyserver und Data Plane für Agenten-Apps. Intelligentes LLM-Routing, Observability, Agenten-Orchestrierung und Guardrails, damit Sie sich auf die Kernlogik Ihrer Agenten konzentrieren können.

    7.033+11Sterne-Änderung der letzten 7 Tage
  • turbo-fieldfare@drumih

    Gemma 4 26B-A4B Inferenz in ca. 2 GB RAM auf jedem M-Series MacBook

    6.666+178Sterne-Änderung der letzten 7 Tage
  • flashinfer@flashinfer-ai

    FlashInfer: Kernel-Bibliothek für LLM-Serving

    6.321+38Sterne-Änderung der letzten 7 Tage
  • cactus@cactus-compute

    Quantisierung, Kernels, Laufzeit und Inferenz-Engine für Mobilgeräte, Wearables, Smart Home und Roboter.

    5.975+20Sterne-Änderung der letzten 7 Tage
  • kserve@kserve

    Standardisierte, verteilte generative und prädiktive KI-Inferenzplattform für skalierbare Bereitstellungen mit mehreren Frameworks auf Kubernetes

    5.853+13Sterne-Änderung der letzten 7 Tage
  • shimmy@Michael-A-Kuykendall

    ⚡ Rein in Rust geschriebene WebGPU-Inferenz-Engine — OpenAI-API-kompatibel, GGUF-nativ, läuft auf jeder GPU. Kein Python. Kein llama.cpp. Einzelne Binärdatei.

    5.816+6Sterne-Änderung der letzten 7 Tage
  • gpustack@gpustack

    Ein GPU-Cluster-Manager für hochleistungsfähiges KI-Modell-Serving (vLLM, SGLang) und bedarfsgesteuerte GPU-Instanzen mit SSH-Zugang.

    5.593+21Sterne-Änderung der letzten 7 Tage
  • lemonade@lemonade-sdk

    Lemonade hilft Benutzern dabei, lokale KI-Apps zu entdecken und auszuführen, indem optimierte LLMs direkt von ihren eigenen GPUs und NPUs bereitgestellt werden. Treten Sie unserem Discord bei: https://discord.gg/5xXzkMu8Zk

    5.585+55Sterne-Änderung der letzten 7 Tage
  • Awesome-LLM-Inference@xlite-dev

    📚 Eine kuratierte Liste fantastischer LLM/VLM-Inferenz-Papers mit Code: Flash-Attention, Paged-Attention, WINT8/4, Parallelismus usw. 🎉

    5.482+3Sterne-Änderung der letzten 7 Tage
  • superduper@superduper-io

    Superduper: End-to-End-Framework zum Erstellen benutzerdefinierter KI-Anwendungen und Agents.

    5.318+1Sterne-Änderung der letzten 7 Tage
  • eko@FellouAI

    Eko (Eko Keeps Operating) – Erstellen Sie produktionsreife agentenbasierte Workflows mit natürlicher Sprache – eko.fellou.ai

    4.954+2Sterne-Änderung der letzten 7 Tage
  • RuVector@ruvnet

    RuVector ist eine in Rust geschriebene Hochleistungs-, Echtzeit-, selbstlernende KI, ein Vektor-GNN und eine In-Memory-Datenbank.

    4.473+6Sterne-Änderung der letzten 7 Tage
  • optillm@algorithmicsuperintelligence

    Optimierung des Inferenz-Proxys für LLMs

    4.260+3Sterne-Änderung der letzten 7 Tage
  • GenerativeAIExamples@NVIDIA

    Generative KI-Referenz-Workflows, optimiert für beschleunigte Infrastruktur und Mikroservice-Architektur.

    4.169+4Sterne-Änderung der letzten 7 Tage
  • lorax@predibase

    Multi-LoRA-Inferenzserver, der auf Tausende von feinabgestimmten LLMs skaliert

    3.827+1Sterne-Änderung der letzten 7 Tage
  • AI-Engineer-Headquarters@hemansnation

    Eine Sammlung wissenschaftlicher Methoden, Prozesse, Algorithmen und Systeme zum Erstellen von Geschichten und Modellen.

    3.676+2Sterne-Änderung der letzten 7 Tage
  • spiceai@spiceai

    Fügen Sie Ihrer operativen Datenbank einen Echtzeit-Analyse-Knoten hinzu. Spice ist eine portable, beschleunigte SQL-Abfrage-, Such- und LLM-Inferenz-Engine in Rust für datengestützte KI-Apps und Agenten.

    3.075+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen