vllm
vllm がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
vllm と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、vllm がタグ付けされたリポジトリ。
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,165 - #2
LLM 推論サービングと最適化のための、1日30分・10週間のロードマップ。vLLM、SGLang、量子化、予測デコード、ベンチマーク。
★ 880
- #1
トレーニング、推論、ストリーミングASR、VAD、句読点、話者ダイアライゼーションパイプライン、およびOpenAI互換/MCPサービングのためのオープンソース音声認識ツールキット
★ 20,136+98直近 7 日のスター増減 - #2
Llama Cookbookへようこそ!これはLlamaを使った構築のためのガイドブックです。推論、ファインチューニング、RAGの始め方を紹介します。また、Llamaモデルファミリーを使用してエンドツーエンドの問題を解決する方法や、様々なプロバイダーサービスでそれらを利用する方法も示します。
★ 18,556-2直近 7 日のスター増減 - #3
✍🏻 ソースコード深掘り、システム設計&エンジニアリングブログ | Halfrost-Field 氷霜之地:ソースコード解析、システム設計とエンジニアリング実践ノート
★ 13,226+6直近 7 日のスター増減 - #4
あらゆるAIモデルに対応した、包括的なAI研究およびエンジニアリングスキルを提供するオープンソースライブラリ。このスキルをパッケージ化することで、あなたのclaude code/codex/geminiエージェントはフルパワーのAI研究エージェントになります。Orchestra Researchによってメンテナンスされています。
★ 12,256+176直近 7 日のスター増減 - #5★ 11,622+152直近 7 日のスター増減
- #6
Rayベースの使いやすいスケーラブルで高性能なエージェンティックRLフレームワーク (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)
★ 9,969+13直近 7 日のスター増減 - #7
単一のコード行を変更するだけで、GPTを任意のLLMに置き換え可能。Xinferenceを使用すると、オープンソース、音声、マルチモーダルモデルをクラウド、オンプレミス、またはラップトップ上で実行できます。すべて統一された本番環境対応の推論APIを介して。
★ 9,537+13直近 7 日のスター増減 - #8★ 7,952+76直近 7 日のスター増減
- #9★ 6,470+70直近 7 日のスター増減
- #10★ 5,853+18直近 7 日のスター増減
- #11★ 5,678+7直近 7 日のスター増減
- #12★ 5,593+32直近 7 日のスター増減
- #13
ローカルのOpenAI/Anthropic互換サーバー(llama.cpp, vllmなど)向けの信頼性の高いモデルスワッピング
★ 5,562+80直近 7 日のスター増減 - #14
異種LLM推論のためのプログラマブルなMixture-of-Modelsルーター
★ 5,506+182直近 7 日のスター増減 - #15
📚コード付きの素晴らしいLLM/VLM推論論文の厳選リスト:Flash-Attention、Paged-Attention、WINT8/4、Parallelismなど🎉
★ 5,482+4直近 7 日のスター増減 - #16★ 5,214+10直近 7 日のスター増減
- #17★ 4,537+14直近 7 日のスター増減
- #18
AIエージェント向けのカスケードランタイム。エージェントループ内でコスト、レイテンシ、品質、ポリシー決定を最適化。
★ 3,970-10直近 7 日のスター増減 - #19
PaddlePaddleベースのLLMおよびVLM向け高性能推論・デプロイメントツールキット
★ 3,714+4直近 7 日のスター増減 - #20
RamaLama は、あらゆるソースからの AI モデルのローカル配信を簡素化し、コンテナのおなじみの操作性を通じて本番環境での推論への利用を容易にするオープンソースの開発者ツールです。
★ 3,031+13直近 7 日のスター増減 - #21
Ascend 上の vLLM 向けコミュニティ維持ハードウェアプラグイン
★ 2,749+31直近 7 日のスター増減 - #22
VLLM、Sglang、llama.cpp、exllamav3 用コントロールパネル
★ 1,749+7直近 7 日のスター増減 - #23
オープンソースの継続的推論ベンチマーク研究プラットフォーム — Kimi K3 2.8T、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72対MI355X対B200対GB300 NVL72、まもなく™ TPUv6e/v7/Trainium2/3 に対応
★ 1,613+51直近 7 日のスター増減 - #24
高精度な低ビット LLM 推論のための SOTA 量子化アルゴリズム。CPU、XPU、CUDA にシームレスに最適化され、多様なデータ型をサポート。vLLM、SGLang、Transformers と完全に互換性があります。
★ 1,599+11直近 7 日のスター増減 - #25
Apple Silicon 向けの高性能な OpenAI および Anthropic 互換 LLM 推論サーバー。ネイティブ MLX、連続バッチ処理、マルチモーダルモデル、MCP ツール呼び出し、Claude Code をサポート。
★ 1,557+9直近 7 日のスター増減 - #26★ 1,275+131直近 7 日のスター増減
- #27★ 1,256+4直近 7 日のスター増減
- #28
HF、vLLM、SGLang を介して Nvidia、AMD、Intel GPU および Intel/AMD/Apple CPU のハードウェアアクセラレーションをサポートする LLM モデル量子化 (圧縮) ツールキット。
★ 1,248+2直近 7 日のスター増減 - #29
🔒 API キーごとのコスト管理やレート制限、監視機能を提供するエンタープライズグレードの API ゲートウェイ。ユーザー、アプリケーション、環境ごとの細やかなアクセス制御と監視を実現。OpenAI、Azure OpenAI、Anthropic、vLLM、およびオープンソース LLM をサポート。
★ 1,228+1直近 7 日のスター増減 - #30
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,165+317直近 7 日のスター増減