sglang
Repositórios de código aberto acompanhados marcados com sglang, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de sglang no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com sglang.
- #1
Um roteiro de 10 semanas, com 30 minutos por dia, para inferência e otimização de LLMs. vLLM, SGLang, quantização, decodificação especulativa, benchmarking.
★ 881 - #2
面向大模型开发者的 SGLang 系统化开源教程:从推理基础与环境搭建开始,逐步学习模型部署、结构化生成、服务开发和性能优化, 结合实战案例带你从 0 到 1 掌握 SGLang,构建高性能 LLM 推理应用
★ 363
- #1
Troque o GPT por qualquer LLM alterando apenas uma linha de código. O Xinference permite executar modelos de código aberto, de fala e multimodais na nuvem, localmente ou no seu laptop — tudo através de uma API de inferência unificada e pronta para produção.
★ 9.537+9Variação de estrelas nos últimos 7 dias - #2★ 7.952+44Variação de estrelas nos últimos 7 dias
- #3
Mooncake é a plataforma de serviço para o Kimi, um serviço de LLM líder fornecido pela Moonshot AI.
★ 6.470+40Variação de estrelas nos últimos 7 dias - #4
OpenClaw-RL: Treine qualquer agente simplesmente conversando
★ 5.665+7Variação de estrelas nos últimos 7 dias - #5
Um gerenciador de cluster de GPU para servir modelos de IA de alto desempenho (vLLM, SGLang) e instâncias de GPU acessíveis via SSH sob demanda.
★ 5.593+21Variação de estrelas nos últimos 7 dias - #6
Painel de controle para VLLM, Sglang, llama.cpp, exllamav3
★ 1.749+7Variação de estrelas nos últimos 7 dias - #7
Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3
★ 1.613+33Variação de estrelas nos últimos 7 dias - #8
Um algoritmo de quantização SOTA para inferência de LLM de baixo bit e alta precisão, otimizado para CPU/XPU/CUDA, com suporte a múltiplos tipos de dados e compatibilidade total com vLLM, SGLang e Transformers.
★ 1.599+8Variação de estrelas nos últimos 7 dias - #9
MOSS-TTSD é um modelo de geração de diálogo falado projetado para síntese expressiva de múltiplos falantes. Ele apresenta modelagem de contexto longo, controle flexível de falante e suporte multilíngue, permitindo clonagem de voz zero-shot a partir de referências de áudio curtas.
★ 1.394+4Variação de estrelas nos últimos 7 dias - #10
Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais
★ 1.275+130Variação de estrelas nos últimos 7 dias - #11
Kit de ferramentas de quantização (compressão) de modelos LLM com suporte a aceleração de hardware para GPUs Nvidia, AMD, Intel e CPUs Intel/AMD/Apple via HF, vLLM e SGLang.
★ 1.248+0Variação de estrelas nos últimos 7 dias - #12
Treine modelos de decodificação especulativa sem esforço e porte-os facilmente para o SGLang.
★ 1.144+14Variação de estrelas nos últimos 7 dias - #13
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 1.118+130Variação de estrelas nos últimos 7 dias - #14★ 1.110+3Variação de estrelas nos últimos 7 dias
- #15
UniRL é um framework para aprendizado por reforço de modelos multimodais unificados
★ 935+15Variação de estrelas nos últimos 7 dias - #16
Um roteiro de 10 semanas, com 30 minutos por dia, para inferência e otimização de LLMs. vLLM, SGLang, quantização, decodificação especulativa, benchmarking.
★ 881+76Variação de estrelas nos últimos 7 dias - #17
Com base em modelos como SparkTTS e OrpheusTTS, fornece serviços de clonagem de voz e síntese de fala em chinês de alta qualidade.
★ 613+1Variação de estrelas nos últimos 7 dias - #18
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
★ 510—Variação de estrelas nos últimos 7 dias - #19
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 506—Variação de estrelas nos últimos 7 dias