开源的 LLM/VLM 负载均衡与服务平台,可用于大规模自托管 LLM(与 VLM)🏓🦙。为 llm-d、Docker Model Runner 等项目的替代方案,但组件更少、部署更简单,并围绕 ggml 生态系统构建。支持 CPU 与 GPU 运行。
radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。