speech-to-text
Repositórios de código aberto acompanhados marcados com speech-to-text, ordenados por estrelas.
- #91
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 1.018+424Variação de estrelas nos últimos 7 dias - #92
:zap: TensorFlowASR: Reconhecimento automático de fala quase estado da arte em Tensorflow 2. Idiomas suportados que podem usar caracteres ou subpalavras
★ 1.010+0Variação de estrelas nos últimos 7 dias - #93★ 1.006-1Variação de estrelas nos últimos 7 dias
- #94
Whisper-Flow é um framework projetado para permitir a transcrição em tempo real de conteúdo de áudio usando o modelo Whisper da OpenAI. Em vez de processar arquivos inteiros após o upload (modo em lote), o Whisper-Flow aceita um fluxo contínuo de partes de áudio e produz transcrições incrementais imediatamente.
★ 964+25Variação de estrelas nos últimos 7 dias - #95
Transcrição de áudio em tempo quase real usando Whisper auto-hospedado e WebSocket em Python/JS
★ 960+0Variação de estrelas nos últimos 7 dias - #96
Processamento de Fala Botium
★ 943+0Variação de estrelas nos últimos 7 dias - #97
Whisper.net. Fala para texto simplificada usando modelos Whisper
★ 942+1Variação de estrelas nos últimos 7 dias - #98
Avalie seu sistema de conversão de fala em texto com medidas de similaridade como a taxa de erro de palavras (WER)
★ 928+2Variação de estrelas nos últimos 7 dias - #99
Exemplos de .NET MAUI
★ 915+0Variação de estrelas nos últimos 7 dias - #100★ 911+2Variação de estrelas nos últimos 7 dias
- #101
Modelos Whisper otimizados para streaming e uso em dispositivos
★ 897-1Variação de estrelas nos últimos 7 dias - #102
Um aplicativo de entrada de voz gratuito, de código aberto e com foco na privacidade para macOS.
★ 896+4Variação de estrelas nos últimos 7 dias - #103
Implementação de reconhecimento de fala em chinês de ponta a ponta baseada em PaddlePaddle, do básico ao avançado, com exemplos simples e projetos corporativos práticos. Suporta os modelos DeepSpeech2, Conformer e Squeezeformer mais populares atualmente.
★ 870-1Variação de estrelas nos últimos 7 dias - #104
💬 Reconhecimento de fala para seu aplicativo React
★ 842+0Variação de estrelas nos últimos 7 dias - #105
Crie aplicações web de speech2text em tempo real usando o Whisper da OpenAI https://openai.com/blog/whisper/
★ 835+0Variação de estrelas nos últimos 7 dias - #106★ 823-1Variação de estrelas nos últimos 7 dias
- #107
Software de geração automática de legendas completo, cobrindo todo o processo de download, transcrição, tradução e gravação, sem necessidade de intervenção humana.
★ 811+3Variação de estrelas nos últimos 7 dias - #108
Ditado de voz gratuito, de código aberto e 100% offline para Linux. Fale e digite em qualquer lugar via motores whisper.cpp, Whisper e VOSK, acelerado por GPU, funciona em X11 + Wayland!
★ 809+17Variação de estrelas nos últimos 7 dias - #109
🎤 Lobe TTS - Uma biblioteca TTS/STT confiável e de alta qualidade para servidor e navegador.
★ 805-1Variação de estrelas nos últimos 7 dias - #110
Fala para Texto para Fala. Música tocando agora. Envia texto como mensagens OSC para o VRChat para exibir no avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 804+5Variação de estrelas nos últimos 7 dias - #111
Chatbot de voz local para conversas envolventes, utilizando Ollama, Hugging Face Transformers e Coqui TTS Toolkit.
★ 788+1Variação de estrelas nos últimos 7 dias - #112
Projeto que permite usar um microfone com o OpenAI Whisper.
★ 787+0Variação de estrelas nos últimos 7 dias - #113
🎤 A maneira mais fácil de transcrever áudio em Swift
★ 785+0Variação de estrelas nos últimos 7 dias - #114
Um aplicativo de transcrição de voz por IA 100% privado que converte fala em texto em mais de 100 idiomas. Construído com Compose Multiplatform para Android e iOS usando Whisper AI - sem uploads para a nuvem, todo o processamento ocorre no dispositivo para total privacidade.
★ 779+4Variação de estrelas nos últimos 7 dias - #115
Um SDK modular em Swift para processamento de áudio com MLX em Apple Silicon
★ 774+5Variação de estrelas nos últimos 7 dias - #116
BiBi Keyboard: um aplicativo de teclado com método de entrada de voz por LLM e ASR para a plataforma Android baseado em Kotlin
★ 774+15Variação de estrelas nos últimos 7 dias - #117
Reconhecimento de fala em chinês implementado com base no PaddlePaddle. Projeto completo com excelentes resultados de reconhecimento. Suporta treinamento e predição em Windows e Linux, além de predição na placa Nvidia Jetson.
★ 763+1Variação de estrelas nos últimos 7 dias - #118★ 754+1Variação de estrelas nos últimos 7 dias
- #119
Executando o modelo de fala para texto (whisper.cpp) no Unity3d em sua máquina local.
★ 751+1Variação de estrelas nos últimos 7 dias - #120
Teclado e serviço de reconhecimento de fala privado e executado no dispositivo para Android.
★ 745+2Variação de estrelas nos últimos 7 dias