vllm
标记 vllm 主题、收录中的开源项目,按星标数排序。
- #31
使用 Prometheus 与 GPT4 评估你的 LLM 响应 💯
★ 1,114+7近 7 天星标变化 - #32★ 1,104+10近 7 天星标变化
- #33★ 1,001+49近 7 天星标变化
- #34★ 950+15近 7 天星标变化
- #35
为期 10 周、每天 30 分钟的 LLM 推理服务与优化学习蓝图。包含 vLLM、SGLang、量化、推测解码、性能评测。
★ 941+21近 7 天星标变化 - #36★ 892+1近 7 天星标变化
- #37
一款本地、离线(初始设置后)、便携的 OCR 软件,可使用 DeepSeek-OCR-2 AI(直接在您的机器上运行)处理图片和 PDF 文件。
★ 873+2近 7 天星标变化 - #38
在 Debian 上搭建您自己的本地且完全私有 LLM 服务器的端到端文档。配备聊天、网页搜索、RAG、模型管理、MCP 服务器、图像生成以及 TTS。
★ 833-3近 7 天星标变化 - #39★ 830+1近 7 天星标变化
- #40★ 788+1近 7 天星标变化
- #41
[EMNLP 2024 & AAAI 2026] 一个强大的大型模型压缩工具包,包含 LLM、VLM 及视频生成模型。
★ 747+3近 7 天星标变化 - #42★ 682+11近 7 天星标变化
- #43★ 674+3近 7 天星标变化
- #44
EfficientSAM3 通过渐进式知识蒸馏将 SAM3 压缩为轻量且适合边缘设备的模型,以实现快速的提示式概念分割与追踪。
★ 671+10近 7 天星标变化 - #45★ 614+2近 7 天星标变化
- #46★ 564+0近 7 天星标变化
- #47★ 555+1近 7 天星标变化
- #48
用于管理与互动 vLLM 服务器的现代化网页界面。支持 GPU 与 CPU 模式,并针对 macOS Apple Silicon 与 OpenShift/Kubernetes 企业部署进行特别优化。
★ 531+3近 7 天星标变化 - #49
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 522+14近 7 天星标变化 - #50
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
★ 517+14近 7 天星标变化 - #51
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 508+4近 7 天星标变化 - #52★ 505-1近 7 天星标变化
- #53
sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems. Live support: https://discord.com/invite/GH5kRgv6ZD
★ 504—近 7 天星标变化