Pular para o conteúdo principal
buildradar
Entrar
Tópico · speech-to-text

speech-to-text

Repositórios de código aberto acompanhados marcados com speech-to-text, ordenados por estrelas.

152 repositórios
  • Coleção de recursos sobre as aplicações de Modelos de Linguagem Grande (LLMs) em Áudio AI.

    738+0Variação de estrelas nos últimos 7 dias
  • MASR@yeyupiaoling

    Framework de reconhecimento automático de fala em PyTorch para streaming e não streaming, compatível com reconhecimento online e offline. Atualmente suporta os modelos Conformer, Squeezeformer e DeepSpeech2, além de vários métodos de aumento de dados.

    727+0Variação de estrelas nos últimos 7 dias
  • voice-ai@rapidaai

    Rapida é uma plataforma de orquestração de IA de voz de ponta a ponta para construir agentes de voz conversacionais em tempo real com streaming de áudio, STT, TTS, VAD, integração multicanal, gerenciamento de estado de agentes e observabilidade.

    723+4Variação de estrelas nos últimos 7 dias
  • adapt@MycroftAI

    Interpretador de intenções Adapt

    719+0Variação de estrelas nos últimos 7 dias
  • curses@mmpneo

    Legendas de fala para texto e entrada de KB para OBS, VRChat, chat do Twitch e Discord

    718-1Variação de estrelas nos últimos 7 dias
  • speech-demo@Baidu-AIP

    Exemplo de API de voz

    707-1Variação de estrelas nos últimos 7 dias
  • Framework de benchmark para conversão de fala em texto.

    698+1Variação de estrelas nos últimos 7 dias
  • WhisperSubTranslate@Blue-B

    Um aplicativo de desktop local e gratuito para extrair legendas (SRT) de vídeos e traduzi-las para qualquer idioma — uso ilimitado, sem cadastro, sem nuvem.

    688+15Variação de estrelas nos últimos 7 dias
  • Reconhecimento de fala para projetos React Native Expo

    678+4Variação de estrelas nos últimos 7 dias
  • openlrc@zh-plus

    Transcreva e traduza áudio em arquivos LRC usando Whisper e LLMs (GPT, Claude, etc.).

    678+0Variação de estrelas nos últimos 7 dias
  • cheetah@Picovoice

    Motor de conversão de fala em texto por streaming no dispositivo impulsionado por aprendizado profundo

    671+0Variação de estrelas nos últimos 7 dias
  • sonus@evancohen

    :speech_balloon: /so.nus/ STT (speech to text) para Node com detecção de palavra-chave offline

    638+0Variação de estrelas nos últimos 7 dias
  • Proctoring-AI@vardanagarwal

    Criando um software para monitoramento automático em proctoring online

    634-1Variação de estrelas nos últimos 7 dias
  • macparakeet@moona3k

    Aplicativo de voz rápido, privado e local-first para Macs com Apple Silicon — ditado, transcrição de arquivos/mídia, gravação de reuniões, Transforms e uma CLI de automação pública. Gratuito e de código aberto.

    630+14Variação de estrelas nos últimos 7 dias
  • pindrop@watzon

    Um aplicativo nativo para a barra de menus do macOS de ditado usando conversão de fala em texto local com o WhisperKit

    620+1Variação de estrelas nos últimos 7 dias
  • CrispASR@CrispStrobe

    Hub de tempo de execução C++ ggml para modelos ASR e TTS multilíngues: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc., além de alinhamento forçado universal e mais

    614+11Variação de estrelas nos últimos 7 dias
  • speech-to-text@reriiasu

    Transcrição em tempo real usando faster-whisper

    614+0Variação de estrelas nos últimos 7 dias
  • Sayboard@ElishaAz

    Um IME (teclado) de voz emulador de dispositivo de código aberto para Android usando a biblioteca Vosk.

    582+3Variação de estrelas nos últimos 7 dias
  • Uma biblioteca Python para resolver reCAPTCHA v2 e v3 com o Playwright

    579+3Variação de estrelas nos últimos 7 dias
  • WhisperS2T@shashikg

    Um pipeline otimizado de Speech-to-Text para o modelo Whisper, suportando múltiplos motores de inferência

    578+0Variação de estrelas nos últimos 7 dias
  • VRCOSC@VolcanicArts

    Uma linguagem de programação baseada em nós modular, criador de programas, sistema de animação, kit de ferramentas, roteador e depurador feitos para VRChat

    563+0Variação de estrelas nos últimos 7 dias
  • Uma sobreposição que obtém a permissão de voz do usuário e a entrada como texto em uma interface personalizável

    557+1Variação de estrelas nos últimos 7 dias
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    547+22Variação de estrelas nos últimos 7 dias
  • Lista de APIs de reconhecimento de voz STT para o idioma coreano. Benchmarks de desempenho de cada uma.

    547+0Variação de estrelas nos últimos 7 dias
  • Talkify@tornikegomareli

    Ditado por voz ultrarrápido, gratuito, local e com transcrição no próprio dispositivo para macOS

    544+11Variação de estrelas nos últimos 7 dias
  • vosk-browser@ccoreilly

    Uma biblioteca de reconhecimento de fala executada no navegador graças a uma compilação WebAssembly do Vosk

    529+1Variação de estrelas nos últimos 7 dias
  • Phonetisaurus@AdolfVonKleist

    Phonetisaurus G2P

    521-1Variação de estrelas nos últimos 7 dias
  • Esta ferramenta usa IA para avaliar sua pronúncia.

    518+1Variação de estrelas nos últimos 7 dias
  • transcribee@bugbakery

    Software de código aberto para transcrição de áudio e vídeo

    515+0Variação de estrelas nos últimos 7 dias
  • Servidor de inferência de linguagem de código aberto, local e auto-hospedado altamente otimizado com suporte a ASR/STT, TTS e LLM via WebRTC, REST e WS

    512+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos