Pular para o conteúdo principal
buildradar
Entrar
Tópico · text-to-speech

text-to-speech

Repositórios de código aberto acompanhados marcados com text-to-speech, ordenados por estrelas.

Repositórios
150
Total de estrelas
955.097
Média de estrelas
6.367
Participação
0,05%

Tópicos que aparecem com frequência ao lado de text-to-speech no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com text-to-speech.

  • qwen-audio-agent@QwenAudio

    Um runtime de voz em tempo real que mantém agentes falando, trabalhando e presentes. Runtime de voz em tempo real para agentes de IA

    2.379
  • audio.cpp@0xShug0

    Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.

    2.214
  • ai-video-editor@MartinDelophy

    Editor de vídeo open-source e local-first onde criadores e agentes de IA editam a mesma linha do tempo real.

    798
  • Ferramenta de tradução de tela em tempo real para Android de código aberto e sem root, ideal para jogos, romances visuais e mangás. Suporta OCR local e em nuvem, LLMs offline, vários serviços de tradução e conversão de texto em fala (TTS), com traduções exibidas diretamente na tela.

    794
  • Talkify@tornikegomareli

    Ditado por voz ultrarrápido, gratuito, local e com transcrição no próprio dispositivo para macOS

    544
  • MoneyPrinterTurbo@harry0703

    Gere vídeos curtos em HD a partir de um tópico ou palavra-chave com um fluxo de trabalho automatizado de IA, utilizando modelos de IA de grande escala e automação.

    119.977+0Variação de estrelas nos últimos 7 dias
  • unsloth@unslothai

    Interface de usuário local para executar e treinar LLMs e modelos de difusão, incluindo Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX e muito mais.

    75.515+0Variação de estrelas nos últimos 7 dias
  • GPT-SoVITS@RVC-Boss

    1 minuto de dados de voz também pode ser usado para treinar um bom modelo de TTS! (clonagem de voz com poucos exemplos)

    61.476+0Variação de estrelas nos últimos 7 dias
  • OpenMontage@calesthio

    O primeiro sistema de produção de vídeo agêntico e de código aberto do mundo. 12 pipelines de produção, mais de 100 ferramentas, mais de 700 arquivos de habilidades de agentes e conhecimento de produção. Transforme seu assistente de codificação de IA em um estúdio completo de produção de vídeo.

    55.719+0Variação de estrelas nos últimos 7 dias
  • TTS@coqui-ai

    🐸💬 - um conjunto de ferramentas de deep learning para conversão de texto em fala (Text-to-Speech), testado em pesquisa e produção

    45.985+0Variação de estrelas nos últimos 7 dias
  • ChatTTS@2noise

    Um modelo de fala gerativa para diálogos cotidianos.

    39.814+0Variação de estrelas nos últimos 7 dias
  • OpenVoice@myshell-ai

    Clonagem de voz instantânea pelo MIT e MyShell. Modelo de fundação de áudio.

    37.419+0Variação de estrelas nos últimos 7 dias
  • MockingBird@babysor

    🚀Clone uma voz em 5 segundos para gerar fala arbitrária em tempo real

    36.912+0Variação de estrelas nos últimos 7 dias
  • VoxCPM@OpenBMB

    VoxCPM2: TTS sem tokenizador para geração de fala multilíngue, design de voz criativo e clonagem realista

    36.595+0Variação de estrelas nos últimos 7 dias
  • index-tts@index-tts

    Um Sistema de Conversão de Texto em Fala Zero-Shot Controlável e Eficiente em Nível Industrial

    23.686+0Variação de estrelas nos últimos 7 dias
  • CosyVoice@QwenAudio

    Modelo multilíngue de geração de voz de grande escala, oferecendo capacidade full-stack de inferência, treinamento e implantação.

    23.426+0Variação de estrelas nos últimos 7 dias
  • dia@nari-labs

    Um modelo de TTS capaz de gerar diálogos ultra-realistas em uma única passagem.

    19.387+0Variação de estrelas nos últimos 7 dias
  • pyvideotrans@jianchang512

    Traduza vídeos de um idioma para outro e incorpore dublagem e legendas.

    18.871+0Variação de estrelas nos últimos 7 dias
  • leon@leon-ai

    🧠 Leon é seu assistente pessoal de código aberto

    17.476+0Variação de estrelas nos últimos 7 dias
  • VoiceStudio@debpalash

    VoiceStudio é a alternativa ao ElevenLabs de código aberto e totalmente local — clonagem de voz, design de voz, dublagem de vídeo, ditado, transcrição e criação de audiolivros em 646 idiomas.

    14.835+0Variação de estrelas nos últimos 7 dias
  • sherpa-onnx@k2-fsa

    Speech-to-text, text-to-speech, diarização de locutor, aprimoramento de fala, separação de fontes e VAD usando a próxima geração do Kaldi com onnxruntime sem conexão com a Internet. Suporte a sistemas embarcados, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket e 12 linguagens de programação

    14.575+0Variação de estrelas nos últimos 7 dias
  • supertonic@supertone-inc

    TTS multilíngue, ultrarrápido e on-device, executado nativamente via ONNX.

    13.757+0Variação de estrelas nos últimos 7 dias
  • voice-pro@abus-aikorea

    Interface Web Gradio para criadores e desenvolvedores, apresentando TTS (Edge-TTS, kokoro) e clonagem de voz zero-shot (E2 & F5-TTS, CosyVoice), com processamento de áudio Whisper, download do YouTube, isolamento vocal Demucs e tradução multilíngue.

    12.730+0Variação de estrelas nos últimos 7 dias
  • edge-tts@rany2

    Use o serviço de conversão de texto em fala online do Microsoft Edge a partir do Python, sem precisar do Microsoft Edge, Windows ou de uma chave de API.

    11.847+0Variação de estrelas nos últimos 7 dias
  • Amphion@open-mmlab

    Amphion (/æmˈfaɪən/) é um kit de ferramentas para geração de áudio, música e fala. Seu objetivo é apoiar pesquisas reprodutíveis e ajudar pesquisadores e engenheiros iniciantes a começar na área de pesquisa e desenvolvimento de geração de áudio, música e fala.

    10.276+0Variação de estrelas nos últimos 7 dias
  • espnet@espnet

    Toolkit de processamento de fala de ponta a ponta

    9.949+0Variação de estrelas nos últimos 7 dias
  • EmotiVoice@netease-youdao

    EmotiVoice 😊: um motor de TTS multivoz e controlado por prompt.

    8.522+0Variação de estrelas nos últimos 7 dias
  • mlx-audio@Blaizzy

    Uma biblioteca de text-to-speech (TTS), speech-to-text (STT) e speech-to-speech (STS) construída sobre o framework MLX da Apple, oferecendo análise de fala eficiente em Apple Silicon.

    7.826+0Variação de estrelas nos últimos 7 dias
  • MeloTTS@myshell-ai

    Biblioteca de conversão de texto em fala multilíngue de alta qualidade da MyShell.ai. Suporta inglês, espanhol, francês, chinês, japonês e coreano.

    7.616+0Variação de estrelas nos últimos 7 dias
  • espeak-ng@espeak-ng

    eSpeak NG é um sintetizador de voz de código aberto que suporta mais de cem idiomas e sotaques.

    6.802+0Variação de estrelas nos últimos 7 dias
  • argmax-oss-swift@argmaxinc

    IA de fala executada localmente no dispositivo para Apple Silicon

    6.353+0Variação de estrelas nos últimos 7 dias
  • StyleTTS2@yl4579

    StyleTTS 2: Rumo à conversão de texto em fala de nível humano através de difusão de estilo e treinamento adversarial com grandes modelos de linguagem de fala

    6.342+0Variação de estrelas nos últimos 7 dias
  • Awesome-Prompt-Engineering@promptslab

    Este repositório contém recursos selecionados manualmente para Prompt Engineering com foco em Generative Pre-trained Transformer (GPT), ChatGPT, PaLM, etc.

    6.306+0Variação de estrelas nos últimos 7 dias
  • silero-models@snakers4

    Silero Models: modelos de conversão de texto em fala pré-treinados feitos de forma extremamente simples

    6.084+0Variação de estrelas nos últimos 7 dias
  • ODS@Osmantic

    Transforme seu PC, Mac ou Linux em um servidor de IA. Inferência de LLM, interface de chat, voz, agentes, fluxos de trabalho, RAG e geração de imagens.

    5.931+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos