Pular para o conteúdo principal
buildradar
Sign in
Tópico · speech

speech

Repositórios de código aberto acompanhados marcados com speech, ordenados por estrelas.

74 repositórios
  • MARS5-TTS@Camb-ai

    Modelo de fala (TTS) MARS5 da CAMB.AI

    2.818+1Variação de estrelas nos últimos 7 dias
  • speechgpt@hahahumble

    SpeechGPT é uma aplicação web que permite conversar com o ChatGPT.

    2.750-1Variação de estrelas nos últimos 7 dias
  • gTTS@pndurette

    Biblioteca Python e ferramenta CLI para interagir com a API de conversão de texto em fala do Google Translate

    2.628+0Variação de estrelas nos últimos 7 dias
  • ten-vad@TEN-framework

    Detector de Atividade de Voz (VAD): baixa latência, alto desempenho e leve

    2.256+7Variação de estrelas nos últimos 7 dias
  • IMS-Toucan@DigitalPhonetics

    Conversão de texto em fala rápida e controlável para mais de 7000 idiomas!

    2.207-1Variação de estrelas nos últimos 7 dias
  • soloud@jarikomppa

    Motor de áudio gratuito, fácil e portátil para jogos

    2.170+3Variação de estrelas nos últimos 7 dias
  • openai-edge-tts@travisvn

    Endpoint de API de conversão de texto em fala gratuito e de alta qualidade para substituir OpenAI, Azure ou ElevenLabs

    2.075+5Variação de estrelas nos últimos 7 dias
  • Praat: Fazendo fonética por computador.

    1.970+1Variação de estrelas nos últimos 7 dias
  • julius@julius-speech

    Motor de reconhecimento de fala contínua de grande vocabulário de código aberto

    1.935+1Variação de estrelas nos últimos 7 dias
  • Lista comunitária de startups que trabalham com IA em tecnologia de áudio e música

    1.769+1Variação de estrelas nos últimos 7 dias
  • SALMONN@bytedance

    Família SALMONN: Um conjunto de LLMs multimodais avançados

    1.521+3Variação de estrelas nos últimos 7 dias
  • voicefixer@haoheliu

    Restauração geral de fala.

    1.375+0Variação de estrelas nos últimos 7 dias
  • CrisperWhisper@nyrahealth

    Transcrição controlável. Verbatim (cada palavra, preenchimento, pausa, gagueira, som vocal) ou pretendida (o que o falante quis dizer, otimizado para legibilidade) com carimbos de data/hora em nível de palavra.

    1.371+13Variação de estrelas nos últimos 7 dias
  • nlp-paper@DengBoCong

    Artigos relacionados ao campo de Processamento de Linguagem Natural (com notas de leitura), modelos de reprodução e processamento de dados (código disponível em TensorFlow e PyTorch).

    1.333+1Variação de estrelas nos últimos 7 dias
  • MTools@HG-ha

    O MTools é um aplicativo de desktop multifuncional poderoso que integra processamento de áudio e vídeo, edição de imagem, manipulação de texto e ferramentas de codificação, com recursos de IA integrados. Projetado para simplificar seu fluxo de trabalho e aumentar a produtividade.

    1.305+5Variação de estrelas nos últimos 7 dias
  • StreamSpeech@ictnlp

    StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.

    1.288+0Variação de estrelas nos últimos 7 dias
  • Deep-Learning-Experiments@roatienza

    Vídeos, notas e experimentos para entender aprendizado profundo

    1.198+0Variação de estrelas nos últimos 7 dias
  • lhotse@lhotse-speech

    Ferramentas para manipular dados multimodais em projetos de aprendizado de máquina.

    1.149-1Variação de estrelas nos últimos 7 dias
  • conformer@sooftware

    [Não oficial] Implementação em PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)

    1.132+1Variação de estrelas nos últimos 7 dias
  • pykaldi@pykaldi

    Um wrapper Python para Kaldi

    1.040+1Variação de estrelas nos últimos 7 dias
  • FireRedTTS@FireRedTeam

    Um sistema TTS de base potencializado por LLM de código aberto

    920+1Variação de estrelas nos últimos 7 dias
  • inaSpeechSegmenter@ina-foss

    Kit de ferramentas de segmentação de áudio baseado em CNN. Permite detectar fala, música, ruído e gênero do locutor. Foi projetado para estudos de igualdade de gênero em larga escala baseados no tempo de fala por gênero.

    910+1Variação de estrelas nos últimos 7 dias
  • diffwave@lmnt-com

    DiffWave é um vocoder neural rápido e de alta qualidade e sintetizador de formas de onda.

    885+0Variação de estrelas nos últimos 7 dias
  • AnyGPT@OpenMOSS

    Código para "AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling"

    881-1Variação de estrelas nos últimos 7 dias
  • PPASR@yeyupiaoling

    Implementação de reconhecimento de fala em chinês de ponta a ponta baseada em PaddlePaddle, do básico ao avançado, com exemplos simples e projetos corporativos práticos. Suporta os modelos DeepSpeech2, Conformer e Squeezeformer mais populares atualmente.

    870-1Variação de estrelas nos últimos 7 dias
  • Voxtral ASR & TTS rodando nativamente e no navegador. Uma implementação em Rust do Voxtral mini realtime ASR / TTS do Mistral usando o framework Burn ML

    819+2Variação de estrelas nos últimos 7 dias
  • AlphaAvatar@AlphaAvatar

    Um Omni Avatar interativo em tempo real construído no LiveKit, que permite integrar perfeitamente com qualquer componente de Avatar de código aberto (modelo em tempo real, visual, voz, memória, pesquisa, etc.).

    813+4Variação de estrelas nos últimos 7 dias
  • XR3Player@goxr3plus

    🎧 🎼 O reprodutor de mídia JavaFX MAIS AVANÇADO

    771+0Variação de estrelas nos últimos 7 dias
  • cboard@cboard-org

    Sistema de Comunicação Aumentativa e Alternativa (CAA) com conversão de texto em fala para o navegador.

    755+9Variação de estrelas nos últimos 7 dias
  • allosaurus@xinjli

    Allosaurus é um reconhecedor universal de fonemas pré-treinado para mais de 2000 idiomas

    746+4Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos