Pular para o conteúdo principal
buildradar
Entrar
Tópico · text-to-speech

text-to-speech

Repositórios de código aberto acompanhados marcados com text-to-speech, ordenados por estrelas.

150 repositórios
  • RHVoice@RHVoice

    Um sintetizador de voz gratuito e de código aberto para russo e outros idiomas.

    1.836+0Variação de estrelas nos últimos 7 dias
  • O sistema de autocodificação para seu aplicativo — Alan AI SDK para Android

    1.807+0Variação de estrelas nos últimos 7 dias
  • Genie-TTS@High-Logic

    Motor de inferência ONNX e conversor de modelos para GPT-SoVITS

    1.760+0Variação de estrelas nos últimos 7 dias
  • O sistema de autocodificação para seu aplicativo — Alan AI SDK para Flutter.

    1.756+0Variação de estrelas nos últimos 7 dias
  • Traduz automaticamente o texto de um vídeo com base em um arquivo de legenda e utiliza serviços de voz por IA para criar uma nova trilha de áudio dublada e traduzida, sincronizada com o tempo das legendas.

    1.746+0Variação de estrelas nos últimos 7 dias
  • read-aloud@ken107

    Uma excelente extensão de navegador que lê em voz alta o conteúdo de páginas da web com um clique

    1.737+0Variação de estrelas nos últimos 7 dias
  • react-native-executorch@software-mansion

    Maneira declarativa de executar modelos de IA no React Native localmente, utilizando o ExecuTorch.

    1.707+0Variação de estrelas nos últimos 7 dias
  • alan-sdk-ionic@alan-ai

    O sistema de auto-codificação para seu aplicativo — Alan AI SDK para Ionic

    1.649+0Variação de estrelas nos últimos 7 dias
  • ParallelWaveGAN@kan-bayashi

    Implementação não oficial de Parallel WaveGAN (+ MelGAN, Multi-band MelGAN, HiFi-GAN e StyleMelGAN) com Pytorch.

    1.646+0Variação de estrelas nos últimos 7 dias
  • dsnote@mkiol

    Aplicativo Speech Note para Linux. Tomada de notas, leitura e tradução com conversão de fala em texto, texto em fala e tradução automática offline.

    1.622+0Variação de estrelas nos últimos 7 dias
  • video-podcast-maker@Agents365-ai

    Tópico → Vídeo narrado em 4K para agentes de codificação. v4.0: todo TTS via componente de motor ttsCN (11 plataformas incluindo clonagem de voz MiniMax, sincronização nativa de legendas em nível de palavra), motor de ativos baseado em manifesto, composição Remotion, geração de IA com limite de custo.

    1.599+0Variação de estrelas nos últimos 7 dias
  • MiniMax-MCP@MiniMax-AI

    Servidor oficial do MiniMax Model Context Protocol (MCP) que permite a interação com poderosas APIs de conversão de texto em fala, geração de imagens e geração de vídeo.

    1.573+0Variação de estrelas nos últimos 7 dias
  • vllm-mlx@waybarrios

    Servidor de inferência LLM de alto desempenho compatível com OpenAI e Anthropic para Apple Silicon. MLX nativo, processamento contínuo, modelos multimodais, chamada de ferramentas MCP e suporte ao Claude Code.

    1.557+0Variação de estrelas nos últimos 7 dias
  • VibeVoice-ComfyUI@Enemyx-net

    Uma integração abrangente do ComfyUI para o modelo de conversão de texto em fala VibeVoice da Microsoft, permitindo síntese de voz de alta qualidade para um ou vários locutores diretamente nos seus fluxos de trabalho do ComfyUI.

    1.555+0Variação de estrelas nos últimos 7 dias
  • soprano@ekwek1

    Soprano: Conversão de texto em fala instantânea e ultrarrealista.

    1.548+0Variação de estrelas nos últimos 7 dias
  • RCLI@RunanywhereAI

    Fale com seu Mac, consulte seus documentos, sem necessidade de nuvem. IA de voz e RAG executados localmente no dispositivo.

    1.542+0Variação de estrelas nos últimos 7 dias
  • TalkingHead@met4citizen

    Talking Head (3D): Uma classe JavaScript para sincronia labial em tempo real usando avatares 3D de corpo inteiro.

    1.522+0Variação de estrelas nos últimos 7 dias
  • Voice-Cloning-App@voice-cloning-app

    Um aplicativo Python/Pytorch para sintetizar vozes humanas facilmente

    1.440+0Variação de estrelas nos últimos 7 dias
  • OuteTTS@edwko

    Interface para modelos OuteTTS.

    1.437+0Variação de estrelas nos últimos 7 dias
  • Auto-hospede o poderoso modelo de TTS Chatterbox. Este servidor oferece uma interface web amigável, endpoints de API flexíveis (incluindo compatibilidade com OpenAI), vozes predefinidas, clonagem de voz e processamento de texto em escala de audiolivros. Executa com aceleração em NVIDIA (CUDA), AMD (ROCm) e CPU.

    1.427+0Variação de estrelas nos últimos 7 dias
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge é um projeto desenvolvido em torno de modelos de geração TTS, implementando um servidor de API e uma interface web baseada em Gradio.

    1.418+0Variação de estrelas nos últimos 7 dias
  • SoniTranslate@R3gm

    Tradução sincronizada para vídeos. Dublagem de vídeo

    1.413+0Variação de estrelas nos últimos 7 dias
  • Uma lista de corpora de fala acessíveis para ASR, TTS e outras tecnologias de fala.

    1.399+0Variação de estrelas nos últimos 7 dias
  • mlx-tune@ARahim3

    Faça o fine-tuning de LLMs no seu Mac com Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding e fine-tuning de OCR — nativamente no MLX. API compatível com Unsloth.

    1.398+0Variação de estrelas nos últimos 7 dias
  • Matcha-TTS@shivammehta25

    [ICASSP 2024] 🍵 Matcha-TTS: Uma arquitetura de TTS rápida com conditional flow matching

    1.353+0Variação de estrelas nos últimos 7 dias
  • WavTokenizer@jishengpeng

    [ICLR 2025] Modelos de codec acústico discreto SOTA com 40/75 tokens por segundo para modelagem de linguagem de áudio.

    1.317+0Variação de estrelas nos últimos 7 dias
  • airunner@Capsize-Games

    Motor de inferência offline para arte, conversas de voz em tempo real, chatbots baseados em LLM e fluxos de trabalho automatizados

    1.314+0Variação de estrelas nos últimos 7 dias
  • StreamSpeech@ictnlp

    StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.

    1.288+0Variação de estrelas nos últimos 7 dias
  • audio-webui@gitmylo

    Uma WebUI para diferentes redes neurais relacionadas a áudio

    1.246+0Variação de estrelas nos últimos 7 dias
  • Irodori-TTS@Aratako

    Um modelo de conversão de texto em fala baseado em Flow Matching com controle de estilo via emoji

    1.228+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos