Pular para o conteúdo principal
buildradar
Sign in
Tópico · speech-to-text

speech-to-text

Repositórios de código aberto acompanhados marcados com speech-to-text, ordenados por estrelas.

152 repositórios
  • dograh@dograh-hq

    Plataforma de voz AI de código aberto. Alternativa auto-hospedada ao Vapi e Retell. On-prem, BYOK para Speech to Speech ou LLM/STT/TTS, com construtor visual de fluxo de trabalho, suporte nativo a MCP e telefonia.

    5.568+45Variação de estrelas nos últimos 7 dias
  • YouDub-webui@liuzhao1225

    Ferramenta de código aberto para localização de vídeos por IA: automatiza o download de vídeos do YouTube/Bilibili, reconhecimento e tradução de legendas, clonagem de voz, mixagem de áudio e gravação de legendas.

    5.404+25Variação de estrelas nos últimos 7 dias
  • stt@jianchang512

    Ferramenta de reconhecimento de voz para texto / Uma ferramenta local para transcrição de áudio e vídeo que roda offline, com saída em JSON, legendas SRT e formato de texto simples

    4.780+9Variação de estrelas nos últimos 7 dias
  • whisper-jax@sanchit-gandhi

    Implementação em JAX do modelo Whisper da OpenAI para aceleração de até 70x em TPU.

    4.679-1Variação de estrelas nos últimos 7 dias
  • fastrtc@gradio-app

    A biblioteca Python para comunicação em tempo real

    4.624+0Variação de estrelas nos últimos 7 dias
  • auto-subs@tmoroney

    Geração de legendas no dispositivo que se conecta diretamente ao DaVinci Resolve, Premiere e After Effects.

    4.122+20Variação de estrelas nos últimos 7 dias
  • Ferramenta de tradução de áudio/fala em tempo real, leve e poderosa, baseada no Windows LiveCaptions.

    3.637+33Variação de estrelas nos últimos 7 dias
  • openless@Open-Less

    Segure uma tecla, fale, solte — texto refinado por IA aparece no seu cursor em qualquer aplicativo. Entrada de voz de código aberto para macOS e Windows.

    3.403+44Variação de estrelas nos últimos 7 dias
  • API de serviço web ASR para o OpenAI Whisper

    3.328+2Variação de estrelas nos últimos 7 dias
  • Executáveis independentes do Whisper e Faster-Whisper para quem não quer lidar com Python.

    3.171+2Variação de estrelas nos últimos 7 dias
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni é um modelo de interação de voz end-to-end de baixa latência e alta qualidade construído sobre o Llama-3.1-8B-Instruct, visando alcançar capacidades de voz no nível do GPT-4o.

    3.147+1Variação de estrelas nos últimos 7 dias
  • willow@HeyWillow

    Alternativa de assistente de voz open source, local e auto-hospedada, concorrente do Amazon Echo/Google Home

    3.101+1Variação de estrelas nos últimos 7 dias
  • whishper@pluja

    Transcreva qualquer áudio para texto, traduza e edite legendas 100% localmente com uma interface web. Baseado em modelos whisper!

    3.068+2Variação de estrelas nos últimos 7 dias
  • lingvo@tensorflow

    Lingvo

    2.864+0Variação de estrelas nos últimos 7 dias
  • whisper-timestamped@linto-ai

    Reconhecimento automático de fala multilíngue com carimbos de data/hora em nível de palavra e confiança

    2.842+1Variação de estrelas nos últimos 7 dias
  • vexa@Vexa-ai

    API de transcrição de reuniões de código aberto para Google Meet, Microsoft Teams e Zoom. Bots de entrada automática, transcrições WebSocket em tempo real e servidor MCP para agentes de IA. Auto-hospedado ou via SaaS.

    2.741+15Variação de estrelas nos últimos 7 dias
  • FluidAudio@FluidInference

    Modelos de áudio CoreML de ponta em seus aplicativos — texto para fala, fala para texto, detecção de atividade de voz e diarização de locutores. Em Swift, impulsionado por código aberto SOTA.

    2.723+13Variação de estrelas nos últimos 7 dias
  • pluely@iamsrikanthnani

    A alternativa de código aberto ao Cluely - Um assistente de IA extremamente rápido e focado em privacidade que funciona perfeitamente durante reuniões, entrevistas e conversas sem que ninguém perceba. Construído com Tauri para desempenho nativo, com apenas 10MB. Completamente indetectável em chamadas de vídeo, compartilhamentos de tela e gravações.

    2.619+12Variação de estrelas nos últimos 7 dias
  • STT@coqui-ai

    🐸STT - O kit de ferramentas de aprendizado profundo para Speech-to-Text. Treinar e implantar modelos STT nunca foi tão fácil.

    2.606+1Variação de estrelas nos últimos 7 dias
  • foundry-local@microsoft
    2.537+6Variação de estrelas nos últimos 7 dias
  • awesome-whisper@sindresorhus

    Lista incrível para o Whisper — um sistema de reconhecimento de fala de código aberto baseado em IA desenvolvido pela OpenAI

    2.375+1Variação de estrelas nos últimos 7 dias
  • openscreen@getopenscreen

    Grave sua tela e publique uma demonstração. Gratuito e open-source, acelerado por GPU, sem marcas d'água e sem assinaturas. Disponível para Windows, macOS e Linux. Mantido ativamente.

    2.287+122Variação de estrelas nos últimos 7 dias
  • ququ@yan5xu

    Alternativa open source e gratuita ao Wispr Flow | Fluxo de trabalho de voz para desktop em chinês de próxima geração, integrando o modelo local FunASR e modelos de linguagem grandes configuráveis.

    2.278+5Variação de estrelas nos últimos 7 dias
  • audio.cpp@0xShug0

    Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.

    2.214+115Variação de estrelas nos últimos 7 dias
  • WhisperJAV@meizhong986

    Gerador de legendas ASR/STT. Utiliza Qwen3-ASR, LLM local, Whisper e TEN-VAD. Robusto contra ruído para JAV.

    2.196+17Variação de estrelas nos últimos 7 dias
  • 🎙 Reconhecimento de fala usando o framework de deep learning tensorflow e redes neurais sequence-to-sequence.

    2.173+0Variação de estrelas nos últimos 7 dias
  • soloud@jarikomppa

    Motor de áudio gratuito, fácil e portátil para jogos

    2.170+3Variação de estrelas nos últimos 7 dias
  • vad@ricky0123

    Detector de atividade de voz (VAD) para navegador com uma API simples.

    2.046+1Variação de estrelas nos últimos 7 dias
  • audapolis@bugbakery

    Um editor para áudio falado com transcrição automática

    1.892+2Variação de estrelas nos últimos 7 dias
  • transcribe.cpp@handy-computer

    Inferência de fala para texto ggml para mais de 16 famílias de modelos

    1.872+19Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos