Pular para o conteúdo principal
buildradar
Sign in
Tópico · tts

tts

Repositórios de código aberto acompanhados marcados com tts, ordenados por estrelas.

189 repositórios
  • alexandria-audiobook@Finrandojin

    Gerador de audiolivros com múltiplas vozes impulsionado por IA — anotação de script por LLM, clonagem de voz, design de voz, treinamento LoRA, controle de estilo por linha e exportação para MP3, M4B com capítulos ou multifaixa para Audacity. Construído sobre o Qwen3-TTS.

    995+16Variação de estrelas nos últimos 7 dias
  • lobe-vidol@lobehub

    🧸 Lobe Vidol - Tornando ídolos virtuais acessíveis a todos

    986+1Variação de estrelas nos últimos 7 dias
  • Step-Audio-EditX@stepfun-ai

    Um poderoso modelo de áudio de aprendizado por reforço baseado em LLM de 3B parâmetros que se destaca na edição de Emoção, estilo de fala e paralinguística, e apresenta robusta conversão de texto em fala zero-shot

    972+2Variação de estrelas nos últimos 7 dias
  • NISQA@gabrielmittag

    NISQA - Avaliação não intrusiva da qualidade de fala e naturalidade de TTS.

    970+2Variação de estrelas nos últimos 7 dias
  • epub2tts@aedocw

    Transforme um arquivo epub ou de texto em um audiolivro

    955-1Variação de estrelas nos últimos 7 dias
  • audio-ai-hub@BinWang28

    O hub para pesquisa de IA de áudio: artigos, modelos abertos, benchmarks e datasets sobre LLMs de áudio, reconhecimento de fala, TTS, música e geração de áudio.

    953+3Variação de estrelas nos últimos 7 dias
  • Tornar as vozes TTS naturais do Azure acessíveis a qualquer aplicativo compatível com SAPI 5.

    933+12Variação de estrelas nos últimos 7 dias
  • FireRedTTS@FireRedTeam

    Um sistema TTS de base potencializado por LLM de código aberto

    921+2Variação de estrelas nos últimos 7 dias
  • SmartJavaAI@geekwenjie

    Caixa de ferramentas de algoritmos de IA offline gratuita em Java, suporta reconhecimento facial, deteção de vivacidade, reconhecimento de expressões, deteção de objetos, segmentação de instâncias, deteção de pedestres, reconhecimento de texto OCR, reconhecimento de matrículas, reconhecimento de tabelas, ASR+TTS, tradução automática e outras funções, disponível através de dependência Maven. Suporta PyTorch e TensorFlow, com modelos principais integrados como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) e Whisper

    908+3Variação de estrelas nos últimos 7 dias
  • mosec@mosecorg

    Um framework de atendimento de modelos ML de alto desempenho, oferece loteamento dinâmico e pipelines de CPU/GPU para explorar totalmente sua máquina de computação

    902+0Variação de estrelas nos últimos 7 dias
  • xtts-webui@daswer123

    Interface web para usar o XTTS e realizar seu ajuste fino.

    895+0Variação de estrelas nos últimos 7 dias
  • diffwave@lmnt-com

    DiffWave é um vocoder neural rápido e de alta qualidade e sintetizador de formas de onda.

    885+0Variação de estrelas nos últimos 7 dias
  • pdf-to-podcast@NVIDIA-AI-Blueprints

    Transforme PDFs em podcasts de IA para conteúdos de áudio envolventes em movimento.

    875+1Variação de estrelas nos últimos 7 dias
  • Easy-Voice-Toolkit@Spr-Aachen

    Um kit de ferramentas amigável para reconhecimento/transcrição/conversão de voz, etc. | Caixa de ferramentas de voz simples e fácil de usar

    873+0Variação de estrelas nos últimos 7 dias
  • bark.cpp@PABannier

    Modelo Bark da Suno AI em C/C++ para geração rápida de texto para fala.

    867+1Variação de estrelas nos últimos 7 dias
  • esp-ai@wangzongming

    A solução de integração de IA mais simples e de menor custo. Se você gosta deste projeto, por favor, dê uma estrela~

    856+2Variação de estrelas nos últimos 7 dias
  • SumatraPDF fork: Chinese EPUB/MOBI, smart PDF dark mode, OCR, TTS, offline dictionary.

    825+12Variação de estrelas nos últimos 7 dias
  • Voxtral ASR & TTS rodando nativamente e no navegador. Uma implementação em Rust do Voxtral mini realtime ASR / TTS do Mistral usando o framework Burn ML

    819+2Variação de estrelas nos últimos 7 dias
  • Kokoros@lucasjinreal

    🔥🔥 Kokoro em Rust. https://huggingface.co/hexgrad/Kokoro-82M TTS insanamente rápido em tempo real com a mais alta qualidade que você já viu.

    816+0Variação de estrelas nos últimos 7 dias
  • gitpodcast@BandarLabs

    Converta qualquer repositório git em um podcast envolvente

    815+0Variação de estrelas nos últimos 7 dias
  • lue@paulilaaso

    Leitor de eBook no terminal com conversão de texto em fala de qualidade de audiolivro — Suporta EPUB, PDF, DOCX, HTML, RTF, TXT e MD.

    806+2Variação de estrelas nos últimos 7 dias
  • lobe-tts@lobehub

    🎤 Lobe TTS - Uma biblioteca TTS/STT confiável e de alta qualidade para servidor e navegador.

    805+1Variação de estrelas nos últimos 7 dias
  • CloneTTS@sipeter

    Um motor de Text-to-Speech (TTS) leve e offline para Android, que permite clonagem de voz integrada em todo o sistema e leitura de texto em alta fidelidade.

    803+4Variação de estrelas nos últimos 7 dias
  • ZerolanLiveRobot@AkagawaTsurunaki

    AI VTuber com LLM, ASR, TTS, OCR, CV e mais tecnologias para fazer transmissão ao vivo ou jogar Minecraft com você.

    802+4Variação de estrelas nos últimos 7 dias
  • Fala para Texto para Fala. Música tocando agora. Envia texto como mensagens OSC para o VRChat para exibir no avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)

    802+3Variação de estrelas nos últimos 7 dias
  • Confucius4-TTS@netease-youdao

    Confucius4-TTS: um mecanismo de TTS multilíngue e interlíngue do tipo zero-shot

    793+9Variação de estrelas nos últimos 7 dias
  • mlx-audio-swift@Blaizzy

    Um SDK modular em Swift para processamento de áudio com MLX em Apple Silicon

    772+6Variação de estrelas nos últimos 7 dias
  • dla@markovka17

    Deep learning para processamento de áudio

    763+1Variação de estrelas nos últimos 7 dias
  • Ferramenta de tradução de tela em tempo real para Android de código aberto e sem root, ideal para jogos, romances visuais e mangás. Suporta OCR local e em nuvem, LLMs offline, vários serviços de tradução e conversão de texto em fala (TTS), com traduções exibidas diretamente na tela.

    757+71Variação de estrelas nos últimos 7 dias
  • vui@fluxions-ai

    Assistente de voz em tempo real — streaming WebRTC, ASR faster-whisper, LLM local, TTS Vui Nano (300M). Compatível com a API Realtime da OpenAI. Clonagem de voz, interrupção (barge-in), ~9× em tempo real em uma 4090. Apache 2.0.

    756+9Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos