Pular para o conteúdo principal
buildradar
Sign in
Tópico · asr

asr

Repositórios de código aberto acompanhados marcados com asr, ordenados por estrelas.

Repositórios
86
Total de estrelas
261.812
Média de estrelas
3.044
Participação
0,01%

Tópicos que aparecem com frequência ao lado de asr no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com asr.

  • audio.cpp@0xShug0

    Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.

    2.214
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • hayamimi@oboroge0

    早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.

    327
  • whisperX@m-bain

    WhisperX: Reconhecimento Automático de Fala com carimbos de data/hora no nível da palavra (& Diarização).

    23.864+61Variação de estrelas nos últimos 7 dias
  • FunASR@modelscope

    Kit de ferramentas de reconhecimento de fala de código aberto para treinamento, inferência, streaming ASR, VAD, pontuação, pipelines de diarização de locutores e atendimento compatível com OpenAI/MCP.

    20.136+64Variação de estrelas nos últimos 7 dias
  • Speech@NVIDIA-NeMo

    Um framework de IA generativa escalável criado para pesquisadores e desenvolvedores que trabalham com Grandes Modelos de Linguagem, Multimodal e IA de Voz (Reconhecimento Automático de Fala e Conversão de Texto em Fala)

    18.379+21Variação de estrelas nos últimos 7 dias
  • vosk-api@alphacep

    API de reconhecimento de fala offline para Android, iOS, Raspberry Pi e servidores com Python, Java, C# e Node.

    15.101+17Variação de estrelas nos últimos 7 dias
  • sherpa-onnx@k2-fsa

    Speech-to-text, text-to-speech, diarização de locutor, aprimoramento de fala, separação de fontes e VAD usando a próxima geração do Kaldi com onnxruntime sem conexão com a Internet. Suporte a sistemas embarcados, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, servidores x86_64, servidor/cliente websocket e 12 linguagens de programação

    14.575+95Variação de estrelas nos últimos 7 dias
  • PaddleSpeech@PaddlePaddle

    Kit de ferramentas de fala fácil de usar, incluindo modelo de aprendizado autossupervisionado, ASR SOTA/Streaming com pontuação, TTS de streaming com frontend de texto, sistema de verificação de locutor, tradução de fala de ponta a ponta e detecção de palavras-chave. Vencedor do prêmio NAACL2022 Best Demo.

    12.676+5Variação de estrelas nos últimos 7 dias
  • speechbrain@speechbrain

    Um kit de ferramentas de fala baseado em PyTorch

    11.802+10Variação de estrelas nos últimos 7 dias
  • SenseVoice@QwenAudio

    Modelo SenseVoiceSmall de código aberto para ASR em mandarim, cantonês, inglês, japonês e coreano, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio.

    9.209+37Variação de estrelas nos últimos 7 dias
  • Esta é uma API Python que permite obter a transcrição/legendas de um vídeo do YouTube. Funciona também para legendas geradas automaticamente e não requer chave de API nem navegador headless, ao contrário de outras soluções baseadas em Selenium.

    8.143+14Variação de estrelas nos últimos 7 dias
  • wukong-robot@wzpan

    🤖 wukong-robot é um projeto de robô de diálogo por voz/alto-falante inteligente simples, flexível e elegante, que suporta conversas de múltiplos turnos com ChatGPT e pode ser o primeiro projeto de alto-falante inteligente de código aberto a suportar interface cérebro-computador.

    7.126+2Variação de estrelas nos últimos 7 dias
  • FunClip@modelscope

    Ferramenta de transcrição de vídeo, geração de legendas e edição assistida por LLM baseada em FunASR, com interface Gradio local.

    6.210+13Variação de estrelas nos últimos 7 dias
  • whisper-diarization@MahmoudAshraf97

    Reconhecimento Automático de Fala com Diarização de Orador baseado no OpenAI Whisper

    5.634+1Variação de estrelas nos últimos 7 dias
  • Recorder@xiangyuecn

    Formatos html5 js gravação mp3 wav ogg webm amr g711a g711u, suporte para PC, Android, alguns navegadores web iOS, Hybrid App (código-fonte de app Android e iOS fornecido), WeChat, exemplo de chat de chamada de voz H5 com reconhecimento de fala ASR e conversão para texto, codificação e decodificação DTMF

    5.631+3Variação de estrelas nos últimos 7 dias
  • wenet@wenet-e2e

    Kit de ferramentas de reconhecimento de fala de ponta a ponta, focado e pronto para produção.

    5.229+1Variação de estrelas nos últimos 7 dias
  • LLPlayer@umlx5h

    O reprodutor de mídia para aprendizado de idiomas, com legendas duplas, legendas geradas por IA, tradução em tempo real e muito mais!

    4.070+12Variação de estrelas nos últimos 7 dias
  • Streamer-Sales@PeterH0323

    Streamer-Sales: um LLM para apresentadores de vendas ao vivo que explica produtos com base em suas características para estimular o desejo de compra do usuário. Inclui um fluxo detalhado de geração de dados e integra LMDeploy para aceleração de inferência, RAG para recuperação aumentada, TTS para conversão de texto em fala, geração de avatares digitais, agentes para consultas de informações em tempo real, ASR para transcrição de áudio, front-end em Vue, back-end em FastAPI e implantação via Docker-compose.

    3.764+1Variação de estrelas nos últimos 7 dias
  • openless@Open-Less

    Segure uma tecla, fale, solte — texto refinado por IA aparece no seu cursor em qualquer aplicativo. Entrada de voz de código aberto para macOS e Windows.

    3.403+44Variação de estrelas nos últimos 7 dias
  • API de serviço web ASR para o OpenAI Whisper

    3.328+2Variação de estrelas nos últimos 7 dias
  • Executáveis independentes do Whisper e Faster-Whisper para quem não quer lidar com Python.

    3.171+2Variação de estrelas nos últimos 7 dias
  • GPA@AutoArk

    [AutoArk] GPA (General Purpose Audio) pode realizar ASR, TTS e conversão de voz com um único modelo compacto!

    3.061+164Variação de estrelas nos últimos 7 dias
  • faster-whisper-GUI@CheshireCC

    Interface gráfica para faster_whisper com PySide6

    2.995+4Variação de estrelas nos últimos 7 dias
  • lingvo@tensorflow

    Lingvo

    2.864+0Variação de estrelas nos últimos 7 dias
  • whisper-timestamped@linto-ai

    Reconhecimento automático de fala multilíngue com carimbos de data/hora em nível de palavra e confiança

    2.842+1Variação de estrelas nos últimos 7 dias
  • FluidAudio@FluidInference

    Modelos de áudio CoreML de ponta em seus aplicativos — texto para fala, fala para texto, detecção de atividade de voz e diarização de locutores. Em Swift, impulsionado por código aberto SOTA.

    2.723+13Variação de estrelas nos últimos 7 dias
  • STT@coqui-ai

    🐸STT - O kit de ferramentas de aprendizado profundo para Speech-to-Text. Treinar e implantar modelos STT nunca foi tão fácil.

    2.606+1Variação de estrelas nos últimos 7 dias
  • AudioNotes@harry0703

    Extraia rapidamente conteúdo de áudio e vídeo e organize-o em notas estruturadas em markdown.

    2.483+7Variação de estrelas nos últimos 7 dias
  • audio.cpp@0xShug0

    Um motor de inferência tudo-em-um em C++ puro para modelos de áudio, alimentado por ggml. Suporta TTS, STT, VAD, conversão de voz, geração de música e mais, com desempenho altamente otimizado. Sem dependência de Python.

    2.214+115Variação de estrelas nos últimos 7 dias
  • FireRedASR@FireRedTeam

    Modelos ASR de nível industrial de código aberto que suportam mandarim, dialetos chineses e inglês, alcançando um novo SOTA em benchmarks públicos de ASR em mandarim, oferecendo também excelente capacidade de reconhecimento de letras de músicas.

    1.975+2Variação de estrelas nos últimos 7 dias
  • transcribe.cpp@handy-computer

    Inferência de fala para texto ggml para mais de 16 famílias de modelos

    1.872+19Variação de estrelas nos últimos 7 dias
  • Framework de IA+IoT de próxima geração para T2/T3/T5AI/ESP32/e mais – Integração rápida de hardware de IA e agentes IoT

    1.816+5Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos