llm-inference
llm-inference がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #61
純粋なJavaによるLlama 3以降の推論
★ 816+0直近 7 日のスター増減 - #62★ 810+5直近 7 日のスター増減
- #63LLM-PowerHouse-A-Curated-Guide-for-Large-Language-Models-with-Custom-Training-and-Inferencing↗@ghimiresunil
LLM-PowerHouse: カスタムトレーニングと推論のための厳選されたチュートリアル、ベストプラクティス、すぐに使えるコードを通じて、LLMの可能性を最大限に引き出す
★ 731+0直近 7 日のスター増減 - #64★ 707+0直近 7 日のスター増減
- #65
USP: 長文脈 Transformer モデルのトレーニングと推論のための統一型(ハイブリッド / 2D)シーケンス並列アテンション
★ 692+2直近 7 日のスター増減 - #66★ 678+9直近 7 日のスター増減
- #67★ 677+2直近 7 日のスター増減
- #68
Apple Silicon で最大 4 倍高速なロスレス LLM デコード。DeepSeek の DSpark および z-lab の DFlash スペキュラティブデコードのネイティブ MLX ポート — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三値 Bonsai-27B。
★ 645+15直近 7 日のスター増減 - #69
Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。
★ 627—直近 7 日のスター増減 - #70★ 613+20直近 7 日のスター増減
- #71
Rockchip NPU 向け Ollama 代替: 最適化された NPU サポート (rkllm) により Rockchip デバイス上で AI およびディープラーニングモデルを実行するための効率的なソリューション
★ 602+6直近 7 日のスター増減 - #72★ 596+0直近 7 日のスター増減
- #73
オープンソースのローカル AI SDK。クラウドや API キーなしでデバイス上で AI を実行可能。GGUF、RAG、画像・音楽・動画生成、音声認識、P2P 推論などをサポート。クロスプラットフォーム対応 (Linux、macOS、Windows、Android、iOS)。
★ 594+15直近 7 日のスター増減 - #74
ブラウザから直接実行できる AI アシスタントを搭載した、ミニマリスト向けのウェブ検索プラットフォーム。デモ: https://felladrin-minisearch.hf.space
★ 585-1直近 7 日のスター増減 - #75★ 582+0直近 7 日のスター増減
- #76★ 580+5直近 7 日のスター増減
- #77
LLM(大規模言語モデル)のファインチューニング
★ 579+1直近 7 日のスター増減 - #78
キャンパス採用やインターンシップに最適なプロジェクト。ゼロから手を動かして、LLaMA2/3およびQwen2.5をサポートする大規模言語モデル(LLM)推論フレームワークを実装します。
★ 573+0直近 7 日のスター増減 - #79★ 560+0直近 7 日のスター増減
- #80
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 522+13直近 7 日のスター増減 - #81
LLM 向けの低遅延かつ高スループットなサービングエンジン
★ 521+1直近 7 日のスター増減 - #82★ 519+3直近 7 日のスター増減
- #83
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 507+3直近 7 日のスター増減 - #84★ 505-1直近 7 日のスター増減