본문으로 건너뛰기
buildradar
Sign in
토픽 · vllm

vllm

vllm 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
52
총 스타
195,358
평균 스타
3,757
비중
0.01%

같은 리포지토리에 vllm 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 vllm 태그가 달린 리포지토리예요.

  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,200
  • LLM 추론 서빙 및 최적화를 위한 10주간, 하루 30분 로드맵. vLLM, SGLang, 양자화, 투기적 디코딩, 벤치마킹.

    881
  • kaggle-tpu-lab@ARahim3

    Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.

    146
  • FunASR@modelscope

    학습, 추론, 스트리밍 ASR, VAD, 구두점, 화자 분리 파이프라인, OpenAI 호환/MCP 서빙을 위한 오픈소스 음성 인식 툴킷.

    20,136+64최근 7일 스타 변화
  • llama-cookbook@meta-llama

    Llama Cookbook에 오신 것을 환영합니다! Llama를 활용한 구축을 위한 필수 가이드로, 추론, 파인튜닝, RAG 시작하기를 다룹니다. 또한 Llama 모델 제품군을 사용하여 엔드투엔드 문제를 해결하고 다양한 제공업체 서비스에서 활용하는 방법을 보여줍니다.

    18,556-3최근 7일 스타 변화
  • ✍🏻 소스코드 심층 분석, 시스템 디자인 및 엔지니어링 블로그 | Halfrost-Field 冰霜之地: 소스 분석, 시스템 디자인 및 엔지니어링 실습 노트

    13,226+6최근 7일 스타 변화
  • AI-Research-SKILLs@Orchestra-Research

    모든 AI 모델을 위한 포괄적인 오픈소스 AI 연구 및 엔지니어링 기술 라이브러리. 기술을 패키징하면 claude code/codex/gemini 에이전트가 완전한 성능을 갖춘 AI 연구 에이전트가 됩니다. Orchestra Research에서 유지 관리합니다.

    12,256+104최근 7일 스타 변화
  • LMCache@LMCache

    LMCache: 가장 빠른 KV 캐시 레이어로 LLM 성능 극대화

    11,622+60최근 7일 스타 변화
  • OpenRLHF@OpenRLHF

    Ray를 기반으로 하는 사용하기 쉽고 확장 가능하며 고성능인 에이전틱 RL 프레임워크 (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & 비동기 RL)

    9,969+9최근 7일 스타 변화
  • inference@xorbitsai

    코드 한 줄만 바꾸면 GPT를 어떤 LLM으로든 교체할 수 있습니다. Xinference를 사용하면 클라우드, 온프레미스, 노트북에서 오픈소스, 음성, 멀티모달 모델을 단일 프로덕션용 통합 추론 API로 실행할 수 있습니다.

    9,537+9최근 7일 스타 변화
  • dynamo@ai-dynamo

    데이터센터 규모의 분산 추론 서빙 프레임워크

    7,952+44최근 7일 스타 변화
  • Mooncake@kvcache-ai

    Mooncake은 Moonshot AI가 제공하는 선도적인 LLM 서비스 Kimi의 서빙 플랫폼입니다.

    6,470+40최근 7일 스타 변화
  • kserve@kserve

    Kubernetes에서의 확장 가능한 멀티 프레임워크 배포를 위한 표준화된 분산 생성형 및 예측형 AI 추론 플랫폼

    5,853+13최근 7일 스타 변화
  • UltraRAG@OpenBMB

    복잡하고 혁신적인 RAG 파이프라인 구축을 위한 로우코드 MCP 프레임워크

    5,678+4최근 7일 스타 변화
  • gpustack@gpustack

    고성능 AI 모델 서빙(vLLM, SGLang) 및 온디맨드 SSH 접근 가능 GPU 인스턴스를 위한 GPU 클러스터 관리자

    5,593+21최근 7일 스타 변화
  • llama-swap@mostlygeek

    로컬 OpenAI/Anthropic 호환 서버(llama.cpp, vllm 등)를 위한 안정적인 모델 스와핑

    5,562+49최근 7일 스타 변화
  • semantic-router@vllm-project

    이질적인 LLM 추론을 위한 프로그래밍 가능한 Mixture-of-Models 라우터

    5,506+101최근 7일 스타 변화
  • Awesome-LLM-Inference@xlite-dev

    📚 코드와 함께 제공되는 엄선된 Awesome LLM/VLM 추론 논문 목록: Flash-Attention, Paged-Attention, WINT8/4, 병렬화 등 🎉

    5,482+3최근 7일 스타 변화
  • sparrow@katanaml

    ML, LLM, Vision LLM을 활용한 구조화된 데이터 추출, 지시 호출 및 에이전트 워크플로우

    5,214+7최근 7일 스타 변화
  • tiny-llm@skyzh

    시스템 엔지니어를 위한 Apple Silicon 기반 LLM 추론 시스템 학습: tiny vLLM + Qwen 빌드

    4,537+8최근 7일 스타 변화
  • cascadeflow@lemony-ai

    AI 에이전트를 위한 캐스케이딩 런타임. 에이전트 루프 내에서 비용, 지연 시간, 품질 및 정책 결정을 최적화합니다.

    3,970-9최근 7일 스타 변화
  • FastDeploy@PaddlePaddle

    PaddlePaddle 기반의 LLM 및 VLM을 위한 고성능 추론 및 배포 툴킷

    3,714+3최근 7일 스타 변화
  • ramalama@containers

    RamaLama는 모든 소스에서 AI 모델의 로컬 서빙을 단순화하고 익숙한 컨테이너 명령어를 통해 프로덕션 환경에서 추론에 활용할 수 있도록 지원하는 오픈소스 개발자 도구입니다.

    3,031+6최근 7일 스타 변화
  • vllm-ascend@vllm-project

    Ascend 기반 vLLM을 위한 커뮤니티 유지보수 하드웨어 플러그인

    2,749+19최근 7일 스타 변화
  • local-studio@sybil-solutions

    VLLM, Sglang, llama.cpp, exllamav3 제어판

    1,749+7최근 7일 스타 변화
  • InferenceX@SemiAnalysisAI

    오픈 소스 지속적 추론 벤치마크 연구 플랫폼 — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 및 곧 출시될™ TPUv6e/v7/Trainium2/3

    1,613+33최근 7일 스타 변화
  • auto-round@intel

    고정밀 저비트 LLM 추론을 위한 SOTA 양자화 알고리즘. CPU/XPU/CUDA에 최적화되었으며, 다양한 데이터 타입을 지원하고 vLLM, SGLang, Transformers와 완벽히 호환됩니다.

    1,599+8최근 7일 스타 변화
  • vllm-mlx@waybarrios

    Apple Silicon을 위한 고성능 OpenAI 및 Anthropic 호환 LLM 추론 서버. 네이티브 MLX, 연속 배치, 멀티모달 모델, MCP 도구 호출 및 Claude Code 지원.

    1,557+6최근 7일 스타 변화
  • kvcached@ovg-project

    동적 GPU 공유 등을 위한 가상화된 일래스틱 KV 캐시

    1,275+130최근 7일 스타 변화
  • kubeai@kubeai-project

    Kubernetes용 AI 추론 오퍼레이터. 프로덕션 환경에서 ML 모델을 서빙하는 가장 쉬운 방법. VLM, LLM, 임베딩 및 음성 인식(STT) 지원.

    1,256+2최근 7일 스타 변화
  • GPTQModel@ModelCloud

    HF, vLLM, SGLang을 통해 Nvidia, AMD, Intel GPU 및 Intel/AMD/Apple CPU의 하드웨어 가속을 지원하는 LLM 모델 양자화(압축) 툴킷.

    1,248+0최근 7일 스타 변화
  • BricksLLM@bricks-cloud

    🔒 API 키별로 비용 및 처리량 제한(rate limit)을 모니터링하고 설정할 수 있는 엔터프라이즈급 API 게이트웨이입니다. 사용자, 애플리케이션 또는 환경별로 세밀한 접근 제어 및 모니터링을 제공합니다. OpenAI, Azure OpenAI, Anthropic, vLLM 및 오픈소스 LLM을 지원합니다.

    1,228-1최근 7일 스타 변화
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1,200+316최근 7일 스타 변화
← 토픽 목록으로