stt
Repositórios de código aberto acompanhados marcados com stt, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de stt no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com stt.
- #1
O medidor de gastos e controle de orçamento para agentes de voz de IA. Mede STT + TTS + LLM + telefonia por chamada, pronto para uso (Pipecat, LiveKit — Python & TypeScript). Interrompe bruscamente o próximo turno antes que ultrapasse o limite. Local, sem conta, sem telemetria. Construído por Floe — controles de custo para Voice AI.
★ 434
- #1
Seu segundo cérebro de IA. Auto-hospedável. Obtenha respostas da web ou dos seus documentos. Crie agentes personalizados, agende automações, faça pesquisas profundas. Transforme qualquer LLM online ou local em sua IA pessoal e autônoma (gpt, claude, gemini, llama, qwen, mistral). Comece agora - grátis.
★ 36.787+149Variação de estrelas nos últimos 7 dias - #2
API de reconhecimento de fala offline para Android, iOS, Raspberry Pi e servidores com Python, Java, C# e Node.
★ 15.084+17Variação de estrelas nos últimos 7 dias - #3
Conversão de fala para texto, reconhecimento de intenção e conversão de texto para fala com latência muito baixa, para a criação de agentes e interfaces de voz
★ 10.964+52Variação de estrelas nos últimos 7 dias - #4
Open Vision Agents da Stream. Crie agentes de voz e visão rapidamente com qualquer modelo ou provedor de vídeo. Utiliza a rede de borda da Stream para latência ultrabaixa.
★ 8.104+9Variação de estrelas nos últimos 7 dias - #5
Ferramenta de reconhecimento de voz para texto / Uma ferramenta local para transcrição de áudio e vídeo que roda offline, com saída em JSON, legendas SRT e formato de texto simples
★ 4.771+7Variação de estrelas nos últimos 7 dias - #6
Transcreva qualquer áudio para texto, traduza e edite legendas 100% localmente com uma interface web. Baseado em modelos whisper!
★ 3.066+5Variação de estrelas nos últimos 7 dias - #7
🐸STT - O kit de ferramentas de aprendizado profundo para Speech-to-Text. Treinar e implantar modelos STT nunca foi tão fácil.
★ 2.605+1Variação de estrelas nos últimos 7 dias - #8
🎙 Reconhecimento de fala usando o framework de deep learning tensorflow e redes neurais sequence-to-sequence.
★ 2.173+1Variação de estrelas nos últimos 7 dias - #9
Brinquedos de IA de voz em tempo real com mais de 100 modelos no Arduino ESP32, com WebSockets seguros e Edge Functions para companheiros e dispositivos de IA.
★ 1.937+4Variação de estrelas nos últimos 7 dias - #10
Conheça Ava, o agente para WhatsApp
★ 1.673+1Variação de estrelas nos últimos 7 dias - #11
Aplicativo Speech Note para Linux. Tomada de notas, leitura e tradução com conversão de fala em texto, texto em fala e tradução automática offline.
★ 1.620+7Variação de estrelas nos últimos 7 dias - #12
Aplicativo assistente Dicio para Android.
★ 1.462+17Variação de estrelas nos últimos 7 dias - #13
🍦 Speech-AI-Forge é um projeto desenvolvido em torno de modelos de geração TTS, implementando um servidor de API e uma interface web baseada em Gradio.
★ 1.418+4Variação de estrelas nos últimos 7 dias - #14
Tradução sincronizada para vídeos. Dublagem de vídeo
★ 1.413+5Variação de estrelas nos últimos 7 dias - #15
Uma lista de corpora de fala acessíveis para ASR, TTS e outras tecnologias de fala.
★ 1.399+0Variação de estrelas nos últimos 7 dias - #16
Plataforma de gerenciamento empresarial Java para ESP32 Xiaozhi, oferecendo uma solução integrada de front-end, back-end e servidor para monitoramento de dispositivos, personalização de voz, troca de personagens e gerenciamento de histórico de conversas.
★ 1.337+0Variação de estrelas nos últimos 7 dias - #17
Plugin de IA Gp.nvim (GPT prompt) para Neovim: sessões de ChatGPT, operações de texto/código instruíveis e fala para texto [OpenAI, Ollama, Anthropic, ..].
★ 1.320+0Variação de estrelas nos últimos 7 dias - #18
Tradução de voz em tempo real — macOS e Windows, TTS gratuito, sem servidor, usando apenas suas chaves de API.
★ 1.277+3Variação de estrelas nos últimos 7 dias - #19
Tradução de voz bidirecional em tempo real para reuniões bilíngues — detecta automaticamente o idioma falado e traduz em ambas as direções, via nuvem ou totalmente offline no dispositivo. Desktop (Windows · macOS · Linux) + extensão de navegador (Chrome · Edge) para Zoom, Meet, Teams e qualquer aplicativo.
★ 1.164+37Variação de estrelas nos últimos 7 dias - #20
NobodyWho é um mecanismo de inferência que permite executar LLMs localmente e de forma eficiente em qualquer dispositivo.
★ 1.081+11Variação de estrelas nos últimos 7 dias - #21
🎤 Lobe TTS - Uma biblioteca TTS/STT confiável e de alta qualidade para servidor e navegador.
★ 805+2Variação de estrelas nos últimos 7 dias - #22
🎙️ Um assistente de produtividade de voz inteligente que transforma fala em texto limpo, ações úteis e conhecimento estruturado. Ajuda os usuários a capturar ideias, comunicar-se naturalmente, automatizar tarefas repetitivas e manter a produtividade em diferentes aplicativos e fluxos de trabalho.
★ 801+6Variação de estrelas nos últimos 7 dias - #23
Fala para Texto para Fala. Música tocando agora. Envia texto como mensagens OSC para o VRChat para exibir no avatar. (STTTS) (Speech to TTS) (VRC STT System) (VTuber TTS)
★ 799+1Variação de estrelas nos últimos 7 dias - #24
Um SDK modular em Swift para processamento de áudio com MLX em Apple Silicon
★ 768+5Variação de estrelas nos últimos 7 dias - #25
Executando o modelo de fala para texto (whisper.cpp) no Unity3d em sua máquina local.
★ 750-2Variação de estrelas nos últimos 7 dias - #26
MLX Omni Server é um servidor de inferência local alimentado pelo framework MLX da Apple, projetado especificamente para chips Apple Silicon (série M). Ele implementa endpoints de API compatíveis com a OpenAI, permitindo integração perfeita com clientes SDK da OpenAI existentes, enquanto aproveita o poder da inferência de ML local.
★ 741+5Variação de estrelas nos últimos 7 dias - #27
Motor de conversão de fala em texto por streaming no dispositivo impulsionado por aprendizado profundo
★ 671+0Variação de estrelas nos últimos 7 dias - #28
:speech_balloon: /so.nus/ STT (speech to text) para Node com detecção de palavra-chave offline
★ 638+0Variação de estrelas nos últimos 7 dias - #29
Um componente React para tornar a correção de transcrições automatizadas de áudio e vídeo mais fácil e rápida. Por BBC News Labs. - Trabalho em progresso
★ 621+0Variação de estrelas nos últimos 7 dias - #30
Hub de tempo de execução C++ ggml para modelos ASR e TTS multilíngues: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., além de alinhamento forçado universal e mais
★ 599+26Variação de estrelas nos últimos 7 dias