vllm
vllm 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 vllm 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 vllm 태그가 달린 리포지토리예요.
- #1
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,200 - #2
LLM 추론 서빙 및 최적화를 위한 10주간, 하루 30분 로드맵. vLLM, SGLang, 양자화, 투기적 디코딩, 벤치마킹.
★ 881 - #3
Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.
★ 146
- #1★ 20,136+64최근 7일 스타 변화
- #2
Llama Cookbook에 오신 것을 환영합니다! Llama를 활용한 구축을 위한 필수 가이드로, 추론, 파인튜닝, RAG 시작하기를 다룹니다. 또한 Llama 모델 제품군을 사용하여 엔드투엔드 문제를 해결하고 다양한 제공업체 서비스에서 활용하는 방법을 보여줍니다.
★ 18,556-3최근 7일 스타 변화 - #3
✍🏻 소스코드 심층 분석, 시스템 디자인 및 엔지니어링 블로그 | Halfrost-Field 冰霜之地: 소스 분석, 시스템 디자인 및 엔지니어링 실습 노트
★ 13,226+6최근 7일 스타 변화 - #4
모든 AI 모델을 위한 포괄적인 오픈소스 AI 연구 및 엔지니어링 기술 라이브러리. 기술을 패키징하면 claude code/codex/gemini 에이전트가 완전한 성능을 갖춘 AI 연구 에이전트가 됩니다. Orchestra Research에서 유지 관리합니다.
★ 12,256+104최근 7일 스타 변화 - #5★ 11,622+60최근 7일 스타 변화
- #6
Ray를 기반으로 하는 사용하기 쉽고 확장 가능하며 고성능인 에이전틱 RL 프레임워크 (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & 비동기 RL)
★ 9,969+9최근 7일 스타 변화 - #7
코드 한 줄만 바꾸면 GPT를 어떤 LLM으로든 교체할 수 있습니다. Xinference를 사용하면 클라우드, 온프레미스, 노트북에서 오픈소스, 음성, 멀티모달 모델을 단일 프로덕션용 통합 추론 API로 실행할 수 있습니다.
★ 9,537+9최근 7일 스타 변화 - #8★ 7,952+44최근 7일 스타 변화
- #9★ 6,470+40최근 7일 스타 변화
- #10★ 5,853+13최근 7일 스타 변화
- #11★ 5,678+4최근 7일 스타 변화
- #12★ 5,593+21최근 7일 스타 변화
- #13
로컬 OpenAI/Anthropic 호환 서버(llama.cpp, vllm 등)를 위한 안정적인 모델 스와핑
★ 5,562+49최근 7일 스타 변화 - #14
이질적인 LLM 추론을 위한 프로그래밍 가능한 Mixture-of-Models 라우터
★ 5,506+101최근 7일 스타 변화 - #15
📚 코드와 함께 제공되는 엄선된 Awesome LLM/VLM 추론 논문 목록: Flash-Attention, Paged-Attention, WINT8/4, 병렬화 등 🎉
★ 5,482+3최근 7일 스타 변화 - #16★ 5,214+7최근 7일 스타 변화
- #17★ 4,537+8최근 7일 스타 변화
- #18
AI 에이전트를 위한 캐스케이딩 런타임. 에이전트 루프 내에서 비용, 지연 시간, 품질 및 정책 결정을 최적화합니다.
★ 3,970-9최근 7일 스타 변화 - #19
PaddlePaddle 기반의 LLM 및 VLM을 위한 고성능 추론 및 배포 툴킷
★ 3,714+3최근 7일 스타 변화 - #20
RamaLama는 모든 소스에서 AI 모델의 로컬 서빙을 단순화하고 익숙한 컨테이너 명령어를 통해 프로덕션 환경에서 추론에 활용할 수 있도록 지원하는 오픈소스 개발자 도구입니다.
★ 3,031+6최근 7일 스타 변화 - #21
Ascend 기반 vLLM을 위한 커뮤니티 유지보수 하드웨어 플러그인
★ 2,749+19최근 7일 스타 변화 - #22
VLLM, Sglang, llama.cpp, exllamav3 제어판
★ 1,749+7최근 7일 스타 변화 - #23
오픈 소스 지속적 추론 벤치마크 연구 플랫폼 — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 및 곧 출시될™ TPUv6e/v7/Trainium2/3
★ 1,613+33최근 7일 스타 변화 - #24
고정밀 저비트 LLM 추론을 위한 SOTA 양자화 알고리즘. CPU/XPU/CUDA에 최적화되었으며, 다양한 데이터 타입을 지원하고 vLLM, SGLang, Transformers와 완벽히 호환됩니다.
★ 1,599+8최근 7일 스타 변화 - #25
Apple Silicon을 위한 고성능 OpenAI 및 Anthropic 호환 LLM 추론 서버. 네이티브 MLX, 연속 배치, 멀티모달 모델, MCP 도구 호출 및 Claude Code 지원.
★ 1,557+6최근 7일 스타 변화 - #26★ 1,275+130최근 7일 스타 변화
- #27
Kubernetes용 AI 추론 오퍼레이터. 프로덕션 환경에서 ML 모델을 서빙하는 가장 쉬운 방법. VLM, LLM, 임베딩 및 음성 인식(STT) 지원.
★ 1,256+2최근 7일 스타 변화 - #28
HF, vLLM, SGLang을 통해 Nvidia, AMD, Intel GPU 및 Intel/AMD/Apple CPU의 하드웨어 가속을 지원하는 LLM 모델 양자화(압축) 툴킷.
★ 1,248+0최근 7일 스타 변화 - #29
🔒 API 키별로 비용 및 처리량 제한(rate limit)을 모니터링하고 설정할 수 있는 엔터프라이즈급 API 게이트웨이입니다. 사용자, 애플리케이션 또는 환경별로 세밀한 접근 제어 및 모니터링을 제공합니다. OpenAI, Azure OpenAI, Anthropic, vLLM 및 오픈소스 LLM을 지원합니다.
★ 1,228-1최근 7일 스타 변화 - #30
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1,200+316최근 7일 스타 변화