メインコンテンツへスキップ
buildradar
Sign in
トピック · vllm

vllm

vllm がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
52
総スター数
195,358
平均スター数
3,757
シェア
0.01%

vllm と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、vllm がタグ付けされたリポジトリ。

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,165
  • LLM 推論サービングと最適化のための、1日30分・10週間のロードマップ。vLLM、SGLang、量子化、予測デコード、ベンチマーク。

    880
  • FunASR@modelscope

    トレーニング、推論、ストリーミングASR、VAD、句読点、話者ダイアライゼーションパイプライン、およびOpenAI互換/MCPサービングのためのオープンソース音声認識ツールキット

    20,136+98直近 7 日のスター増減
  • llama-cookbook@meta-llama

    Llama Cookbookへようこそ!これはLlamaを使った構築のためのガイドブックです。推論、ファインチューニング、RAGの始め方を紹介します。また、Llamaモデルファミリーを使用してエンドツーエンドの問題を解決する方法や、様々なプロバイダーサービスでそれらを利用する方法も示します。

    18,556-2直近 7 日のスター増減
  • ✍🏻 ソースコード深掘り、システム設計&エンジニアリングブログ | Halfrost-Field 氷霜之地:ソースコード解析、システム設計とエンジニアリング実践ノート

    13,226+6直近 7 日のスター増減
  • AI-Research-SKILLs@Orchestra-Research

    あらゆるAIモデルに対応した、包括的なAI研究およびエンジニアリングスキルを提供するオープンソースライブラリ。このスキルをパッケージ化することで、あなたのclaude code/codex/geminiエージェントはフルパワーのAI研究エージェントになります。Orchestra Researchによってメンテナンスされています。

    12,256+176直近 7 日のスター増減
  • LMCache@LMCache

    LMCache: 最速のKVキャッシュレイヤーでLLMを強化

    11,622+152直近 7 日のスター増減
  • OpenRLHF@OpenRLHF

    Rayベースの使いやすいスケーラブルで高性能なエージェンティックRLフレームワーク (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

    9,969+13直近 7 日のスター増減
  • inference@xorbitsai

    単一のコード行を変更するだけで、GPTを任意のLLMに置き換え可能。Xinferenceを使用すると、オープンソース、音声、マルチモーダルモデルをクラウド、オンプレミス、またはラップトップ上で実行できます。すべて統一された本番環境対応の推論APIを介して。

    9,537+13直近 7 日のスター増減
  • dynamo@ai-dynamo

    データセンター規模の分散推論サービングフレームワーク

    7,952+76直近 7 日のスター増減
  • Mooncake@kvcache-ai

    Mooncakeは、Moonshot AIが提供する主要なLLMサービスKimiの提供プラットフォームです。

    6,470+70直近 7 日のスター増減
  • kserve@kserve

    Kubernetes上でのスケーラブルなマルチフレームワーク展開に対応した標準化された分散型生成AIおよび予測AI推論プラットフォーム

    5,853+18直近 7 日のスター増減
  • UltraRAG@OpenBMB

    複雑で革新的なRAGパイプラインを構築するためのローコードMCPフレームワーク

    5,678+7直近 7 日のスター増減
  • gpustack@gpustack

    高性能なAIモデルサービング(vLLM, SGLang)およびオンデマンドのSSHアクセス可能なGPUインスタンスのためのGPUクラスターマネージャー。

    5,593+32直近 7 日のスター増減
  • llama-swap@mostlygeek

    ローカルのOpenAI/Anthropic互換サーバー(llama.cpp, vllmなど)向けの信頼性の高いモデルスワッピング

    5,562+80直近 7 日のスター増減
  • semantic-router@vllm-project

    異種LLM推論のためのプログラマブルなMixture-of-Modelsルーター

    5,506+182直近 7 日のスター増減
  • Awesome-LLM-Inference@xlite-dev

    📚コード付きの素晴らしいLLM/VLM推論論文の厳選リスト:Flash-Attention、Paged-Attention、WINT8/4、Parallelismなど🎉

    5,482+4直近 7 日のスター増減
  • sparrow@katanaml

    ML、LLM、Vision LLMを用いた構造化データ抽出、指示呼び出し、エージェントワークフロー

    5,214+10直近 7 日のスター増減
  • tiny-llm@skyzh

    システムエンジニア向けにApple Silicon上でのLLM推論システムを学習:tinyなvLLM + Qwenを構築

    4,537+14直近 7 日のスター増減
  • cascadeflow@lemony-ai

    AIエージェント向けのカスケードランタイム。エージェントループ内でコスト、レイテンシ、品質、ポリシー決定を最適化。

    3,970-10直近 7 日のスター増減
  • FastDeploy@PaddlePaddle

    PaddlePaddleベースのLLMおよびVLM向け高性能推論・デプロイメントツールキット

    3,714+4直近 7 日のスター増減
  • ramalama@containers

    RamaLama は、あらゆるソースからの AI モデルのローカル配信を簡素化し、コンテナのおなじみの操作性を通じて本番環境での推論への利用を容易にするオープンソースの開発者ツールです。

    3,031+13直近 7 日のスター増減
  • vllm-ascend@vllm-project

    Ascend 上の vLLM 向けコミュニティ維持ハードウェアプラグイン

    2,749+31直近 7 日のスター増減
  • local-studio@sybil-solutions

    VLLM、Sglang、llama.cpp、exllamav3 用コントロールパネル

    1,749+7直近 7 日のスター増減
  • InferenceX@SemiAnalysisAI

    オープンソースの継続的推論ベンチマーク研究プラットフォーム — Kimi K3 2.8T、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72対MI355X対B200対GB300 NVL72、まもなく™ TPUv6e/v7/Trainium2/3 に対応

    1,613+51直近 7 日のスター増減
  • auto-round@intel

    高精度な低ビット LLM 推論のための SOTA 量子化アルゴリズム。CPU、XPU、CUDA にシームレスに最適化され、多様なデータ型をサポート。vLLM、SGLang、Transformers と完全に互換性があります。

    1,599+11直近 7 日のスター増減
  • vllm-mlx@waybarrios

    Apple Silicon 向けの高性能な OpenAI および Anthropic 互換 LLM 推論サーバー。ネイティブ MLX、連続バッチ処理、マルチモーダルモデル、MCP ツール呼び出し、Claude Code をサポート。

    1,557+9直近 7 日のスター増減
  • kvcached@ovg-project

    動的な GPU 共有などのための仮想化 Elastic KV キャッシュ

    1,275+131直近 7 日のスター増減
  • kubeai@kubeai-project

    Kubernetes向けAI推論オペレーター。本番環境でMLモデルをホストする最も簡単な方法。VLM、LLM、埋め込み、音声認識をサポート。

    1,256+4直近 7 日のスター増減
  • GPTQModel@ModelCloud

    HF、vLLM、SGLang を介して Nvidia、AMD、Intel GPU および Intel/AMD/Apple CPU のハードウェアアクセラレーションをサポートする LLM モデル量子化 (圧縮) ツールキット。

    1,248+2直近 7 日のスター増減
  • BricksLLM@bricks-cloud

    🔒 API キーごとのコスト管理やレート制限、監視機能を提供するエンタープライズグレードの API ゲートウェイ。ユーザー、アプリケーション、環境ごとの細やかなアクセス制御と監視を実現。OpenAI、Azure OpenAI、Anthropic、vLLM、およびオープンソース LLM をサポート。

    1,228+1直近 7 日のスター増減
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,165+317直近 7 日のスター増減
← トピック一覧に戻る