Zum Hauptinhalt springen
buildradar
Sign in
Thema · llm-inference

llm-inference

Erfasste Open-Source-Repos mit dem Tag llm-inference, sortiert nach Sternen.

83 Repos
  • Verteilte LLM-Inferenz. Verbinden Sie Heimgeräte zu einem leistungsstarken Cluster, um die LLM-Inferenz zu beschleunigen. Mehr Geräte bedeuten eine schnellere Inferenz.

    3.050+5Sterne-Änderung der letzten 7 Tage
  • Medusa@FasterDecoding

    Medusa: Einfaches Framework zur Beschleunigung der LLM-Generierung mit mehreren Decoding-Heads

    2.771+1Sterne-Änderung der letzten 7 Tage
  • EAGLE@SafeAILab

    Offizielle Implementierung von EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) und EAGLE-3 (NeurIPS'25).

    2.521+11Sterne-Änderung der letzten 7 Tage
  • nanocoder@Nano-Collective

    Ein offener Coding-Agent für dein Terminal, entwickelt von einem Community-Kollektiv statt von einem Unternehmen. Bring dein eigenes Modell mit, behalte deinen Code auf deinem Rechner und schulde niemandem etwas.

    2.439+54Sterne-Änderung der letzten 7 Tage
  • neuron-ai@neuron-core

    Das Agentic-Framework des PHP-Ökosystems zum Erstellen von produktionsreifen, KI-gesteuerten Anwendungen. Verbinden Sie Komponenten (LLMs, Tools, Vektor-DBs, Speicher) mit Agenten, die mit Ihren Daten und Ihrer Benutzeroberfläche interagieren.

    2.086+25Sterne-Änderung der letzten 7 Tage
  • aici@microsoft

    AICI: Prompts als (Wasm)-Programme

    2.076+0Sterne-Änderung der letzten 7 Tage
  • llama2-webui@liltom-eth

    Führe Llama 2 lokal mit einer Gradio UI auf GPU oder CPU von überall aus (Linux/Windows/Mac) aus. Nutze `llama2-wrapper` als lokales Llama2-Backend für generative Agents/Apps.

    1.936-1Sterne-Änderung der letzten 7 Tage
  • beta9@beam-cloud

    Ultraschnelle, serverlose GPU-Inferenz, Sandboxes und Hintergrundjobs

    1.764+9Sterne-Änderung der letzten 7 Tage
  • react-native-executorch@software-mansion

    Deklarative Möglichkeit, KI-Modelle in React Native auf dem Gerät auszuführen, angetrieben von ExecuTorch.

    1.707+5Sterne-Änderung der letzten 7 Tage
  • InferenceX@SemiAnalysisAI

    Open-Source-Forschungsplattform für kontinuierliche Inferenz-Benchmarks — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & bald™ TPUv6e/v7/Trainium2/3

    1.613+51Sterne-Änderung der letzten 7 Tage
  • xllm@xLLM-AI

    Eine hochleistungsfähige Inferenz-Engine für LLM-, VLM-, DiT- und REC-Modelle, optimiert für verschiedene KI-Beschleuniger. Gehostet von der OpenAtom Foundation.

    1.552+15Sterne-Änderung der letzten 7 Tage
  • aigrantsindia@aigrantsindia

    Die Non-Profit-Organisation, die KI in Indien durch Credits, Zuschüsse und Ressourcen fördert

    1.461+57Sterne-Änderung der letzten 7 Tage
  • BrowserAI@sauravpanda

    Führe lokale LLMs wie llama, deepseek-distill, kokoro und mehr direkt im Browser aus

    1.449+0Sterne-Änderung der letzten 7 Tage
  • Liste von Software zur Websuche mit KI-Unterstützung: https://hf.co/spaces/felladrin/awesome-ai-web-search

    1.426+9Sterne-Änderung der letzten 7 Tage
  • Atomic-Chat@AtomicBot-ai

    Lokale KI-App und Inferenz-Engine für Agenten. Führen Sie Open-Weight-LLMs lokal aus — privat, 100% offline auf Ihrem Computer. Treten Sie unserem Discord bei: https://discord.com/invite/8wGSsvmg4V

    1.413+35Sterne-Änderung der letzten 7 Tage
  • scaling-book@jax-ml

    Heimat von "How To Scale Your Model", einem kurzen, blog-artigen Lehrbuch über die Skalierung von LLMs auf TPUs

    1.396+23Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Sammlung erstklassiger Penetrationstesting-Tools und Produktivitätsdienstprogramme für verschiedene Bereiche. Machen Sie mit, um Ihr Hacking-Toolkit zu erkunden, beizutragen und zu verbessern!

    1.383+2Sterne-Änderung der letzten 7 Tage
  • LeanCopilot@lean-dojo

    LLMs als Copiloten für das Theorem-Beweisen in Lean

    1.318+2Sterne-Änderung der letzten 7 Tage
  • kvcached@ovg-project

    Virtualisierter Elastic KV Cache für dynamisches GPU-Sharing und mehr

    1.275+131Sterne-Änderung der letzten 7 Tage
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1.164+317Sterne-Änderung der letzten 7 Tage
  • prompt-poet@character-ai

    Optimiert und vereinfacht das Prompt-Design für Entwickler und nicht-technische Anwender mit einem Low-Code-Ansatz.

    1.154-1Sterne-Änderung der letzten 7 Tage
  • tiny-vllm@jmaczan

    Baue deine eigene performante LLM-Inferenz-Engine in C++ und CUDA – eine kleinere Version von vLLM

    1.094+9Sterne-Änderung der letzten 7 Tage
  • OpenAlpha_Evolve@shyamsaktawat

    OpenAlpha_Evolve ist ein Open-Source-Python-Framework, inspiriert von der bahnbrechenden Forschung zu autonomen Coding-Agenten wie DeepMinds AlphaEvolve.

    1.049+2Sterne-Änderung der letzten 7 Tage
  • AI-Compass@tingaicompass

    „AI-Compass“ weist der Community den Weg im Ozean der KI-Technologien. Egal ob Anfänger oder fortgeschrittener Entwickler, hier findet jeder den Pfad zu den verschiedenen KI-Richtungen. Ziel ist es, Entwicklern zu helfen, die Kernkonzepte, Mainstream-Technologien und Zukunftstrends von KI systematisch zu verstehen und den gesamten Prozess von der Theorie bis zur Praxis durch Übung zu meistern.

    933+10Sterne-Änderung der letzten 7 Tage
  • Liste hervorragender Hosting-Anbieter, sortiert nach dem günstigsten Tarif

    925+2Sterne-Änderung der letzten 7 Tage
  • Reine C++-Implementierung verschiedener Modelle für Echtzeit-Chats auf Ihrem Computer (CPU & GPU)

    924+1Sterne-Änderung der letzten 7 Tage
  • ZhiLight@zhihu

    Eine hochoptimierte LLM-Inferenz-Beschleunigungs-Engine für Llama und dessen Varianten.

    908+0Sterne-Änderung der letzten 7 Tage
  • llm_note@harleyszhang

    LLM-Notizen einschließlich Modellinferenz, Transformer-Modellstruktur und Quellcodeanalyse von LLM-Frameworks.

    889+1Sterne-Änderung der letzten 7 Tage
  • Ein 10-wöchiger, 30 Minuten pro Tag umfassender Fahrplan für LLM-Inferenz-Serving und -Optimierung. vLLM, SGLang, Quantisierung, spekulatives Decoding, Benchmarking.

    880+100Sterne-Änderung der letzten 7 Tage
  • LLM.swift@eastriverlee

    LLM.swift ist eine einfache und gut lesbare Bibliothek, mit der Sie für macOS, iOS, watchOS, tvOS und visionOS ganz einfach lokal mit Large Language Models interagieren können.

    874+2Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen