Zum Hauptinhalt springen
buildradar
Sign in
Thema · llm-inference

llm-inference

Erfasste Open-Source-Repos mit dem Tag llm-inference, sortiert nach Sternen.

84 Repos
  • llama3.java@mukel

    Llama-3+-Inferenz in reinem Java

    816+0Sterne-Änderung der letzten 7 Tage
  • lws@kubernetes-sigs

    LeaderWorkerSet: Eine API zur Bereitstellung einer Gruppe von Pods als Replikationseinheit

    810+8Sterne-Änderung der letzten 7 Tage
  • LLM-PowerHouse: Schöpfen Sie das Potenzial von LLMs durch kuratierte Tutorials, Best Practices und sofort einsatzbereiten Code für benutzerdefiniertes Training und Inferenz voll aus.

    731+0Sterne-Änderung der letzten 7 Tage
  • llmflows@stoyan-stoyanov

    LLMFlows – Einfache, explizite und transparente LLM-Apps

    707+0Sterne-Änderung der letzten 7 Tage
  • long-context-attention@feifeibear

    USP: Unified (bzw. Hybrid, 2D) Sequence Parallel Attention für das Training und die Inferenz von Long-Context-Transformer-Modellen

    692+3Sterne-Änderung der letzten 7 Tage
  • pegainfer@pegainfer-project

    Reines Rust + CUDA LLM-Inferenz-Engine — kein PyTorch, OpenAI-kompatibel, bedient Qwen3 bis Kimi-K2

    678+17Sterne-Änderung der letzten 7 Tage
  • atlas@Avarok-Cybersecurity

    Reine Rust-Inferenz-Engine

    677+4Sterne-Änderung der letzten 7 Tage
  • mlx-dspark@ARahim3

    Bis zu 4-fach schnellere LLM-Dekodierung auf Apple Silicon, verlustfrei. Natives MLX-Port von DeepSeek DSpark & z-lab DFlash speculative decoding – Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    645+30Sterne-Änderung der letzten 7 Tage
  • hipfire@warpfront

    RDNA-native LLM-Inferenz-Engine in Rust.

    613+46Sterne-Änderung der letzten 7 Tage
  • rkllama@NotPunchnox

    Ollama-Alternative für Rockchip NPU: Eine effiziente Lösung zum Ausführen von KI- und Deep-Learning-Modellen auf Rockchip-Geräten mit optimierter NPU-Unterstützung (rkllm)

    602+5Sterne-Änderung der letzten 7 Tage
  • zero-to-sglang@datawhalechina

    面向大模型开发者的 SGLang 系统化开源教程:从推理基础与环境搭建开始,逐步学习模型部署、结构化生成、服务开发和性能优化, 结合实战案例带你从 0 到 1 掌握 SGLang,构建高性能 LLM 推理应用

    601Sterne-Änderung der letzten 7 Tage
  • yalm@andrewkchan

    Yet Another Language Model: LLM-Inferenz in C++/CUDA, ohne externe Bibliotheken außer für I/O.

    596-1Sterne-Änderung der letzten 7 Tage
  • qvac@tetherto

    Open-Source-lokales KI-SDK – Führen Sie KI geräteintern ohne Cloud, ohne API-Schlüssel aus. Unterstützt GGUF, RAG, Bild-, Musik- und Videoerstellung, Sprache-zu-Text, P2P-Inferenz und mehr. Plattformübergreifend: Linux, macOS, Windows, Android, iOS.

    594+35Sterne-Änderung der letzten 7 Tage
  • MiniSearch@felladrin

    Minimalistische Websuchplattform mit einem KI-Assistenten, der direkt im Browser läuft. Demo: https://felladrin-minisearch.hf.space

    585+0Sterne-Änderung der letzten 7 Tage
  • uzi@devflowinc

    CLI zur parallelen Ausführung einer Vielzahl von Coding-Agents mit git worktrees.

    582+0Sterne-Änderung der letzten 7 Tage
  • LLM-Hub@timmyy123

    Lokaler KI-Assistent

    580+9Sterne-Änderung der letzten 7 Tage
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    LLM (Large Language Model) Fine-Tuning.

    579+1Sterne-Änderung der letzten 7 Tage
  • KuiperLLama@zjhellofss

    Ein Projekt für Praktika und Berufseinstieg, das Sie Schritt für Schritt bei der Implementierung eines LLM-Inferenz-Frameworks mit Unterstützung für Llama2/3 und Qwen2.5 anleitet.

    573+1Sterne-Änderung der letzten 7 Tage
  • qwen600@yassa9

    Statische, minimalistische Single-Batch-Inferenz-Engine für qwen3-0.6B, ausschließlich für CUDA

    559+0Sterne-Änderung der letzten 7 Tage
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    521+17Sterne-Änderung der letzten 7 Tage
  • sarathi-serve@microsoft

    Eine Serving-Engine mit niedriger Latenz und hohem Durchsatz für LLMs

    521+0Sterne-Änderung der letzten 7 Tage
  • krasis@brontoguana

    Krasis ist eine hybride LLM-Laufzeitumgebung, die auf den effizienten Betrieb größerer Modelle auf Hardware mit begrenztem VRAM für Endverbraucher spezialisiert ist.

    519+3Sterne-Änderung der letzten 7 Tage
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    507Sterne-Änderung der letzten 7 Tage
  • vllm-cli@Chen-zexi

    Ein Kommandozeilen-Tool zur Bereitstellung von LLMs mittels vLLM.

    505-1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen