speech
Repositórios de código aberto acompanhados marcados com speech, ordenados por estrelas.
- #31★ 2.818+1Variação de estrelas nos últimos 7 dias
- #32★ 2.750-1Variação de estrelas nos últimos 7 dias
- #33
Biblioteca Python e ferramenta CLI para interagir com a API de conversão de texto em fala do Google Translate
★ 2.628+0Variação de estrelas nos últimos 7 dias - #34★ 2.256+7Variação de estrelas nos últimos 7 dias
- #35
Conversão de texto em fala rápida e controlável para mais de 7000 idiomas!
★ 2.207-1Variação de estrelas nos últimos 7 dias - #36★ 2.170+3Variação de estrelas nos últimos 7 dias
- #37
Endpoint de API de conversão de texto em fala gratuito e de alta qualidade para substituir OpenAI, Azure ou ElevenLabs
★ 2.075+5Variação de estrelas nos últimos 7 dias - #38
Praat: Fazendo fonética por computador.
★ 1.970+1Variação de estrelas nos últimos 7 dias - #39
Motor de reconhecimento de fala contínua de grande vocabulário de código aberto
★ 1.935+1Variação de estrelas nos últimos 7 dias - #40
Lista comunitária de startups que trabalham com IA em tecnologia de áudio e música
★ 1.769+1Variação de estrelas nos últimos 7 dias - #41★ 1.521+3Variação de estrelas nos últimos 7 dias
- #42
Restauração geral de fala.
★ 1.375+0Variação de estrelas nos últimos 7 dias - #43
Transcrição controlável. Verbatim (cada palavra, preenchimento, pausa, gagueira, som vocal) ou pretendida (o que o falante quis dizer, otimizado para legibilidade) com carimbos de data/hora em nível de palavra.
★ 1.371+13Variação de estrelas nos últimos 7 dias - #44
Artigos relacionados ao campo de Processamento de Linguagem Natural (com notas de leitura), modelos de reprodução e processamento de dados (código disponível em TensorFlow e PyTorch).
★ 1.333+1Variação de estrelas nos últimos 7 dias - #45
O MTools é um aplicativo de desktop multifuncional poderoso que integra processamento de áudio e vídeo, edição de imagem, manipulação de texto e ferramentas de codificação, com recursos de IA integrados. Projetado para simplificar seu fluxo de trabalho e aumentar a produtividade.
★ 1.305+5Variação de estrelas nos últimos 7 dias - #46
StreamSpeech é um modelo "tudo em um" contínuo para reconhecimento, tradução e síntese de fala offline e simultânea.
★ 1.288+0Variação de estrelas nos últimos 7 dias - #47
Vídeos, notas e experimentos para entender aprendizado profundo
★ 1.198+0Variação de estrelas nos últimos 7 dias - #48
Ferramentas para manipular dados multimodais em projetos de aprendizado de máquina.
★ 1.149-1Variação de estrelas nos últimos 7 dias - #49
[Não oficial] Implementação em PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)
★ 1.132+1Variação de estrelas nos últimos 7 dias - #50★ 1.040+1Variação de estrelas nos últimos 7 dias
- #51
Um sistema TTS de base potencializado por LLM de código aberto
★ 920+1Variação de estrelas nos últimos 7 dias - #52
Kit de ferramentas de segmentação de áudio baseado em CNN. Permite detectar fala, música, ruído e gênero do locutor. Foi projetado para estudos de igualdade de gênero em larga escala baseados no tempo de fala por gênero.
★ 910+1Variação de estrelas nos últimos 7 dias - #53
DiffWave é um vocoder neural rápido e de alta qualidade e sintetizador de formas de onda.
★ 885+0Variação de estrelas nos últimos 7 dias - #54★ 881-1Variação de estrelas nos últimos 7 dias
- #55
Implementação de reconhecimento de fala em chinês de ponta a ponta baseada em PaddlePaddle, do básico ao avançado, com exemplos simples e projetos corporativos práticos. Suporta os modelos DeepSpeech2, Conformer e Squeezeformer mais populares atualmente.
★ 870-1Variação de estrelas nos últimos 7 dias - #56
Voxtral ASR & TTS rodando nativamente e no navegador. Uma implementação em Rust do Voxtral mini realtime ASR / TTS do Mistral usando o framework Burn ML
★ 819+2Variação de estrelas nos últimos 7 dias - #57
Um Omni Avatar interativo em tempo real construído no LiveKit, que permite integrar perfeitamente com qualquer componente de Avatar de código aberto (modelo em tempo real, visual, voz, memória, pesquisa, etc.).
★ 813+4Variação de estrelas nos últimos 7 dias - #58★ 771+0Variação de estrelas nos últimos 7 dias
- #59
Sistema de Comunicação Aumentativa e Alternativa (CAA) com conversão de texto em fala para o navegador.
★ 755+9Variação de estrelas nos últimos 7 dias - #60
Allosaurus é um reconhecedor universal de fonemas pré-treinado para mais de 2000 idiomas
★ 746+4Variação de estrelas nos últimos 7 dias