llm-inference
llm-inference がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
llm-inference と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、llm-inference がタグ付けされたリポジトリ。
- #1
2.78兆パラメータのKimi K3を単一CPU上で8.24 GBのRAMで推論実行。ポータブルC99: BLAS、フレームワーク、GPUなし。
★ 6,871 - #2
MシリーズのMacBookであれば、約2GBのRAMでGemma 4 26B-A4Bの推論を実行可能。
★ 6,516 - #3
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #4
LLM 推論サービングと最適化のための、1日30分・10週間のロードマップ。vLLM、SGLang、量子化、予測デコード、ベンチマーク。
★ 808 - #5
Apple Silicon で最大 4 倍高速なロスレス LLM デコード。DeepSeek の DSpark および z-lab の DFlash スペキュラティブデコードのネイティブ MLX ポート — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三値 Bonsai-27B。
★ 624
- #1★ 77,396-4直近 7 日のスター増減
- #2★ 43,647+70直近 7 日のスター増減
- #3★ 29,008+115直近 7 日のスター増減
- #4
本プロジェクトは、大規模モデル関連の技術原理および実戦経験(大規模モデルのエンジニアリング、大規模モデルのアプリケーション実装)を共有することを目的としています。
★ 24,974+46直近 7 日のスター増減 - #5★ 13,636+17直近 7 日のスター増減
- #6★ 12,523+19直近 7 日のスター増減
- #7★ 10,763+72直近 7 日のスター増減
- #8
ローカルデプロイメントのための高速大規模言語モデルサービング
★ 9,758+31直近 7 日のスター増減 - #9★ 8,813+18直近 7 日のスター増減
- #10★ 8,033+20直近 7 日のスター増減
- #11★ 7,908+86直近 7 日のスター増減
- #12
AlphaEvolveのオープンソース実装
★ 7,285+36直近 7 日のスター増減 - #13
Planoは、エージェンティックアプリのためのAIネイティブなプロキシサーバーおよびデータプレーンです。スマートなLLMルーティング、オブザーバビリティ、エージェントオーケストレーション、ガードレールを提供し、エージェントのコアロジックに集中できます。
★ 7,022+9直近 7 日のスター増減 - #14
2.78兆パラメータのKimi K3を単一CPU上で8.24 GBのRAMで推論実行。ポータブルC99: BLAS、フレームワーク、GPUなし。
★ 6,871+485直近 7 日のスター増減 - #15
MシリーズのMacBookであれば、約2GBのRAMでGemma 4 26B-A4Bの推論を実行可能。
★ 6,516+228直近 7 日のスター増減 - #16
FlashInfer: LLMサービングのためのカーネルライブラリ
★ 6,283+76直近 7 日のスター増減 - #17★ 5,955+71直近 7 日のスター増減
- #18★ 5,840+25直近 7 日のスター増減
- #19
⚡ 純粋なRustによるWebGPU推論エンジン — OpenAI-API互換、GGUFネイティブ、あらゆるGPUで動作。Python不要。llama.cpp不要。単一バイナリ。
★ 5,810+35直近 7 日のスター増減 - #20★ 5,572+37直近 7 日のスター増減
- #21
Lemonadeは、ユーザーが自身のGPUやNPUから最適化されたLLMを配信することで、ローカルAIアプリの発見と実行を支援します。Discordに参加: https://discord.gg/5xXzkMu8Zk
★ 5,530+95直近 7 日のスター増減 - #22
📚コード付きの素晴らしいLLM/VLM推論論文の厳選リスト:Flash-Attention、Paged-Attention、WINT8/4、Parallelismなど🎉
★ 5,479+8直近 7 日のスター増減 - #23
Superduper: カスタムAIアプリケーションおよびエージェントを構築するためのエンドツーエンドフレームワーク。
★ 5,317+4直近 7 日のスター増減 - #24★ 4,952+0直近 7 日のスター増減
- #25★ 4,467+27直近 7 日のスター増減
- #26★ 4,257+8直近 7 日のスター増減
- #27
加速化されたインフラストラクチャとマイクロサービスアーキテクチャに最適化された生成AIリファレンスワークフロー。
★ 4,165+10直近 7 日のスター増減 - #28★ 3,826-2直近 7 日のスター増減
- #29
物語やモデルを構築するための科学的手法、プロセス、アルゴリズム、システムのコレクション。
★ 3,674+2直近 7 日のスター増減 - #30
オペクショナルデータベースにリアルタイム分析ノードを追加します。Spice は、データグラウンデッドな AI アプリやエージェント向けに Rust で書かれた、ポータブルで高速化された SQL クエリ、検索、LLM 推論エンジンです。
★ 3,074+5直近 7 日のスター増減