メインコンテンツへスキップ
buildradar
トピック · llm-inference

llm-inference

llm-inference がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
81
総スター数
404,768
平均スター数
4,997
シェア
0.02%

llm-inference と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、llm-inference がタグ付けされたリポジトリ。

  • kimi-k3-in-c@FareedKhan-dev

    2.78兆パラメータのKimi K3を単一CPU上で8.24 GBのRAMで推論実行。ポータブルC99: BLAS、フレームワーク、GPUなし。

    6,871
  • turbo-fieldfare@drumih

    MシリーズのMacBookであれば、約2GBのRAMでGemma 4 26B-A4Bの推論を実行可能。

    6,516
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908
  • LLM 推論サービングと最適化のための、1日30分・10週間のロードマップ。vLLM、SGLang、量子化、予測デコード、ベンチマーク。

    808
  • mlx-dspark@ARahim3

    Apple Silicon で最大 4 倍高速なロスレス LLM デコード。DeepSeek の DSpark および z-lab の DFlash スペキュラティブデコードのネイティブ MLX ポート — Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、Ornith-1.0、三値 Bonsai-27B。

    624
  • gpt4all@nomic-ai

    GPT4All: あらゆるデバイスでローカルLLMを実行。オープンソースで商用利用可能。

    77,396-4直近 7 日のスター増減
  • ray@ray-project

    RayはAIコンピューティングエンジンです。Rayは、コアとなる分散ランタイムと、MLワークロードを高速化するためのAIライブラリ群で構成されています。

    43,647+70直近 7 日のスター増減
  • gitleaks@gitleaks

    Gitleaksでシークレットを検索 🔑

    29,008+115直近 7 日のスター増減
  • llm-action@liguodongiot

    本プロジェクトは、大規模モデル関連の技術原理および実戦経験(大規模モデルのエンジニアリング、大規模モデルのアプリケーション実装)を共有することを目的としています。

    24,974+46直近 7 日のスター増減
  • litgpt@Lightning-AI

    事前学習、ファインチューニング、および大規模展開のためのレシピを備えた20以上の高性能LLM。

    13,636+17直近 7 日のスター増減
  • OpenLLM@bentoml

    DeepSeekやLlamaなどのオープンソースLLMを、クラウド上でOpenAI互換のAPIエンドポイントとして実行できます。

    12,523+19直近 7 日のスター増減
  • openvino@openvinotoolkit

    OpenVINO™は、AI推論の最適化とデプロイのためのオープンソースツールキットです。

    10,763+72直近 7 日のスター増減
  • PowerInfer@Tiiny-AI

    ローカルデプロイメントのための高速大規模言語モデルサービング

    9,758+31直近 7 日のスター増減
  • BentoML@bentoml

    AIアプリやモデルを配信する最も簡単な方法 - モデル推論API、ジョブキュー、LLMアプリ、マルチモデルパイプラインなどを構築!

    8,813+18直近 7 日のスター増減
  • lmdeploy@InternLM

    LMDeployは、LLMの圧縮、デプロイ、サービングのためのツールキットである。

    8,033+20直近 7 日のスター増減
  • dynamo@ai-dynamo

    データセンター規模の分散推論サービングフレームワーク

    7,908+86直近 7 日のスター増減
  • openevolve@algorithmicsuperintelligence

    AlphaEvolveのオープンソース実装

    7,285+36直近 7 日のスター増減
  • plano@katanemo

    Planoは、エージェンティックアプリのためのAIネイティブなプロキシサーバーおよびデータプレーンです。スマートなLLMルーティング、オブザーバビリティ、エージェントオーケストレーション、ガードレールを提供し、エージェントのコアロジックに集中できます。

    7,022+9直近 7 日のスター増減
  • kimi-k3-in-c@FareedKhan-dev

    2.78兆パラメータのKimi K3を単一CPU上で8.24 GBのRAMで推論実行。ポータブルC99: BLAS、フレームワーク、GPUなし。

    6,871+485直近 7 日のスター増減
  • turbo-fieldfare@drumih

    MシリーズのMacBookであれば、約2GBのRAMでGemma 4 26B-A4Bの推論を実行可能。

    6,516+228直近 7 日のスター増減
  • flashinfer@flashinfer-ai

    FlashInfer: LLMサービングのためのカーネルライブラリ

    6,283+76直近 7 日のスター増減
  • cactus@cactus-compute

    モバイル、ウェアラブル、スマートホーム、ロボット向けの量子化、カーネル、ランタイム、推論エンジン。

    5,955+71直近 7 日のスター増減
  • kserve@kserve

    Kubernetes上でのスケーラブルなマルチフレームワーク展開に対応した標準化された分散型生成AIおよび予測AI推論プラットフォーム

    5,840+25直近 7 日のスター増減
  • shimmy@Michael-A-Kuykendall

    ⚡ 純粋なRustによるWebGPU推論エンジン — OpenAI-API互換、GGUFネイティブ、あらゆるGPUで動作。Python不要。llama.cpp不要。単一バイナリ。

    5,810+35直近 7 日のスター増減
  • gpustack@gpustack

    高性能なAIモデルサービング(vLLM, SGLang)およびオンデマンドのSSHアクセス可能なGPUインスタンスのためのGPUクラスターマネージャー。

    5,572+37直近 7 日のスター増減
  • lemonade@lemonade-sdk

    Lemonadeは、ユーザーが自身のGPUやNPUから最適化されたLLMを配信することで、ローカルAIアプリの発見と実行を支援します。Discordに参加: https://discord.gg/5xXzkMu8Zk

    5,530+95直近 7 日のスター増減
  • Awesome-LLM-Inference@xlite-dev

    📚コード付きの素晴らしいLLM/VLM推論論文の厳選リスト:Flash-Attention、Paged-Attention、WINT8/4、Parallelismなど🎉

    5,479+8直近 7 日のスター増減
  • superduper@superduper-io

    Superduper: カスタムAIアプリケーションおよびエージェントを構築するためのエンドツーエンドフレームワーク。

    5,317+4直近 7 日のスター増減
  • eko@FellouAI

    Eko (Eko Keeps Operating) - 自然言語による本番環境対応のエージェンティックワークフローを構築 - eko.fellou.ai

    4,952+0直近 7 日のスター増減
  • RuVector@ruvnet

    RuVectorは、Rustで構築された高性能、リアルタイム、自己学習型のAI、Vector GNN、Memory DBです。

    4,467+27直近 7 日のスター増減
  • optillm@algorithmicsuperintelligence

    LLMの推論プロキシの最適化

    4,257+8直近 7 日のスター増減
  • GenerativeAIExamples@NVIDIA

    加速化されたインフラストラクチャとマイクロサービスアーキテクチャに最適化された生成AIリファレンスワークフロー。

    4,165+10直近 7 日のスター増減
  • lorax@predibase

    数千のファインチューニングされたLLMに対応するマルチLoRA推論サーバー。

    3,826-2直近 7 日のスター増減
  • AI-Engineer-Headquarters@hemansnation

    物語やモデルを構築するための科学的手法、プロセス、アルゴリズム、システムのコレクション。

    3,674+2直近 7 日のスター増減
  • spiceai@spiceai

    オペクショナルデータベースにリアルタイム分析ノードを追加します。Spice は、データグラウンデッドな AI アプリやエージェント向けに Rust で書かれた、ポータブルで高速化された SQL クエリ、検索、LLM 推論エンジンです。

    3,074+5直近 7 日のスター増減
← トピック一覧に戻る