llm-inference
Erfasste Open-Source-Repos mit dem Tag llm-inference, sortiert nach Sternen.
- #31
Verteilte LLM-Inferenz. Verbinden Sie Heimgeräte zu einem leistungsstarken Cluster, um die LLM-Inferenz zu beschleunigen. Mehr Geräte bedeuten eine schnellere Inferenz.
★ 3.050+5Sterne-Änderung der letzten 7 Tage - #32
Medusa: Einfaches Framework zur Beschleunigung der LLM-Generierung mit mehreren Decoding-Heads
★ 2.771+1Sterne-Änderung der letzten 7 Tage - #33
Offizielle Implementierung von EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) und EAGLE-3 (NeurIPS'25).
★ 2.521+11Sterne-Änderung der letzten 7 Tage - #34
Ein offener Coding-Agent für dein Terminal, entwickelt von einem Community-Kollektiv statt von einem Unternehmen. Bring dein eigenes Modell mit, behalte deinen Code auf deinem Rechner und schulde niemandem etwas.
★ 2.439+54Sterne-Änderung der letzten 7 Tage - #35
Das Agentic-Framework des PHP-Ökosystems zum Erstellen von produktionsreifen, KI-gesteuerten Anwendungen. Verbinden Sie Komponenten (LLMs, Tools, Vektor-DBs, Speicher) mit Agenten, die mit Ihren Daten und Ihrer Benutzeroberfläche interagieren.
★ 2.086+25Sterne-Änderung der letzten 7 Tage - #36★ 2.076+0Sterne-Änderung der letzten 7 Tage
- #37
Führe Llama 2 lokal mit einer Gradio UI auf GPU oder CPU von überall aus (Linux/Windows/Mac) aus. Nutze `llama2-wrapper` als lokales Llama2-Backend für generative Agents/Apps.
★ 1.936-1Sterne-Änderung der letzten 7 Tage - #38★ 1.764+9Sterne-Änderung der letzten 7 Tage
- #39
Deklarative Möglichkeit, KI-Modelle in React Native auf dem Gerät auszuführen, angetrieben von ExecuTorch.
★ 1.707+5Sterne-Änderung der letzten 7 Tage - #40
Open-Source-Forschungsplattform für kontinuierliche Inferenz-Benchmarks — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & bald™ TPUv6e/v7/Trainium2/3
★ 1.613+51Sterne-Änderung der letzten 7 Tage - #41
Eine hochleistungsfähige Inferenz-Engine für LLM-, VLM-, DiT- und REC-Modelle, optimiert für verschiedene KI-Beschleuniger. Gehostet von der OpenAtom Foundation.
★ 1.552+15Sterne-Änderung der letzten 7 Tage - #42
Die Non-Profit-Organisation, die KI in Indien durch Credits, Zuschüsse und Ressourcen fördert
★ 1.461+57Sterne-Änderung der letzten 7 Tage - #43
Führe lokale LLMs wie llama, deepseek-distill, kokoro und mehr direkt im Browser aus
★ 1.449+0Sterne-Änderung der letzten 7 Tage - #44
Liste von Software zur Websuche mit KI-Unterstützung: https://hf.co/spaces/felladrin/awesome-ai-web-search
★ 1.426+9Sterne-Änderung der letzten 7 Tage - #45
Lokale KI-App und Inferenz-Engine für Agenten. Führen Sie Open-Weight-LLMs lokal aus — privat, 100% offline auf Ihrem Computer. Treten Sie unserem Discord bei: https://discord.com/invite/8wGSsvmg4V
★ 1.413+35Sterne-Änderung der letzten 7 Tage - #46
Heimat von "How To Scale Your Model", einem kurzen, blog-artigen Lehrbuch über die Skalierung von LLMs auf TPUs
★ 1.396+23Sterne-Änderung der letzten 7 Tage - #47
Eine kuratierte Sammlung erstklassiger Penetrationstesting-Tools und Produktivitätsdienstprogramme für verschiedene Bereiche. Machen Sie mit, um Ihr Hacking-Toolkit zu erkunden, beizutragen und zu verbessern!
★ 1.383+2Sterne-Änderung der letzten 7 Tage - #48
LLMs als Copiloten für das Theorem-Beweisen in Lean
★ 1.318+2Sterne-Änderung der letzten 7 Tage - #49★ 1.275+131Sterne-Änderung der letzten 7 Tage
- #50
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1.164+317Sterne-Änderung der letzten 7 Tage - #51
Optimiert und vereinfacht das Prompt-Design für Entwickler und nicht-technische Anwender mit einem Low-Code-Ansatz.
★ 1.154-1Sterne-Änderung der letzten 7 Tage - #52
Baue deine eigene performante LLM-Inferenz-Engine in C++ und CUDA – eine kleinere Version von vLLM
★ 1.094+9Sterne-Änderung der letzten 7 Tage - #53
OpenAlpha_Evolve ist ein Open-Source-Python-Framework, inspiriert von der bahnbrechenden Forschung zu autonomen Coding-Agenten wie DeepMinds AlphaEvolve.
★ 1.049+2Sterne-Änderung der letzten 7 Tage - #54
„AI-Compass“ weist der Community den Weg im Ozean der KI-Technologien. Egal ob Anfänger oder fortgeschrittener Entwickler, hier findet jeder den Pfad zu den verschiedenen KI-Richtungen. Ziel ist es, Entwicklern zu helfen, die Kernkonzepte, Mainstream-Technologien und Zukunftstrends von KI systematisch zu verstehen und den gesamten Prozess von der Theorie bis zur Praxis durch Übung zu meistern.
★ 933+10Sterne-Änderung der letzten 7 Tage - #55
Liste hervorragender Hosting-Anbieter, sortiert nach dem günstigsten Tarif
★ 925+2Sterne-Änderung der letzten 7 Tage - #56
Reine C++-Implementierung verschiedener Modelle für Echtzeit-Chats auf Ihrem Computer (CPU & GPU)
★ 924+1Sterne-Änderung der letzten 7 Tage - #57
Eine hochoptimierte LLM-Inferenz-Beschleunigungs-Engine für Llama und dessen Varianten.
★ 908+0Sterne-Änderung der letzten 7 Tage - #58
LLM-Notizen einschließlich Modellinferenz, Transformer-Modellstruktur und Quellcodeanalyse von LLM-Frameworks.
★ 889+1Sterne-Änderung der letzten 7 Tage - #59
Ein 10-wöchiger, 30 Minuten pro Tag umfassender Fahrplan für LLM-Inferenz-Serving und -Optimierung. vLLM, SGLang, Quantisierung, spekulatives Decoding, Benchmarking.
★ 880+100Sterne-Änderung der letzten 7 Tage - #60
LLM.swift ist eine einfache und gut lesbare Bibliothek, mit der Sie für macOS, iOS, watchOS, tvOS und visionOS ganz einfach lokal mit Large Language Models interagieren können.
★ 874+2Sterne-Änderung der letzten 7 Tage