Aller au contenu principal
buildradar
Sign in
Sujet · asr

asr

Dépôts open source suivis étiquetés asr, triés par étoiles.

86 dépôts
  • sherpa-ncnn@k2-fsa

    Reconnaissance vocale en temps réel et détection d'activité vocale (VAD) utilisant la nouvelle génération de Kaldi avec ncnn, sans connexion Internet. Supporte iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A, etc.

    1 777-1Évolution des étoiles sur les 7 derniers jours
  • bailing@wwbin2017

    Bailing est un assistant vocal conversationnel similaire à GPT-4o, utilisant ASR, LLM et TTS. Intègre des modèles comme DeepSeek R1 et openClaw, avec une latence réduite à 800ms, fonctionnant sur Mac et configurations légères.

    1 759+2Évolution des étoiles sur les 7 derniers jours
  • dsnote@mkiol

    Application Linux Speech Note. Prise de notes, lecture et traduction avec reconnaissance vocale, synthèse vocale et traduction automatique hors ligne.

    1 622+8Évolution des étoiles sur les 7 derniers jours
  • video-analyzer@byjlw

    Analyser des vidéos en utilisant des LLM, la vision par ordinateur et la reconnaissance automatique de la parole

    1 570+8Évolution des étoiles sur les 7 derniers jours
  • amical@amicalhq

    🎙️ Application de dictée IA - Open Source et locale. ⚡ Tapez 3 fois plus vite, sans clavier. 🆓 Propulsée par des modèles open source, fonctionne hors ligne, rapide et précise.

    1 520+8Évolution des étoiles sur les 7 derniers jours
  • Fun-ASR@QwenAudio

    Famille de modèles ASR open-source basés sur LLM pour le chinois, les dialectes, les accents et la parole multilingue, avec runtimes FunASR, vLLM, streaming et llama.cpp.

    1 512+10Évolution des étoiles sur les 7 derniers jours
  • Speech-AI-Forge@lenML

    Speech-AI-Forge est un projet articulé autour d'un modèle de génération TTS, implémentant un serveur API et une interface Web basée sur Gradio.

    1 418+0Évolution des étoiles sur les 7 derniers jours
  • SoniTranslate@R3gm

    Traduction synchronisée pour vidéos. Doublage vidéo.

    1 413+2Évolution des étoiles sur les 7 derniers jours
  • CrisperWhisper@nyrahealth

    Transcription contrôlable. Verbatim (chaque mot, remplissage, pause, bégaiement, son vocal) ou intentionnelle (ce que l'orateur voulait dire, optimisé pour la lisibilité) avec horodatage au niveau du mot.

    1 371+13Évolution des étoiles sur les 7 derniers jours
  • voicemode@mbailey

    Conversations vocales naturelles avec Claude Code.

    1 347+6Évolution des étoiles sur les 7 derniers jours
  • VideoChat@Henry-23

    Humain numérique interactif en temps réel, avec apparence et voix personnalisables, support du clonage vocal et latence de dialogue aussi basse que 3 secondes.

    1 303-1Évolution des étoiles sur les 7 derniers jours
  • StreamSpeech@ictnlp

    StreamSpeech est un modèle tout-en-un fluide pour la reconnaissance vocale, la traduction et la synthèse vocale, en mode hors ligne et simultané.

    1 288+0Évolution des étoiles sur les 7 derniers jours
  • vosk-server@alphacep

    Serveur de reconnaissance vocale WebSocket, gRPC et WebRTC basé sur les bibliothèques Vosk et Kaldi.

    1 262+1Évolution des étoiles sur les 7 derniers jours
  • Whisper-Finetune@yeyupiaoling

    Fine-tuning du modèle de reconnaissance vocale Whisper pour prendre en charge l'entraînement avec ou sans données d'horodatage, ainsi que sans données vocales. Accélération de l'inférence et support du déploiement Web, Windows et Android

    1 222-1Évolution des étoiles sur les 7 derniers jours
  • speech-swift@soniqo

    Boîte à outils vocale IA pour Apple Silicon — ASR, TTS, speech-to-speech, VAD et diarisation propulsés par MLX et CoreML

    1 161+4Évolution des étoiles sur les 7 derniers jours
  • Mega-ASR@xzf-thu

    Premier ASR de fondation conçu pour le monde réel - 7 conditions acoustiques atomiques, 54 scénarios composés, 2,6 millions d'échantillons et jusqu'à ~30 % de gains par rapport à l'état de l'art là où tous les autres modèles échouent.

    1 136+3Évolution des étoiles sur les 7 derniers jours
  • conformer@sooftware

    [Non officiel] Implémentation PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020).

    1 132+1Évolution des étoiles sur les 7 derniers jours
  • sglang-omni@sgl-project

    SGLang-Omni permet un service haute performance pour les modèles TTS, ASR, vocaux et omnimodaux.

    1 118+143Évolution des étoiles sur les 7 derniers jours
  • violin@shang-zhu

    Compétence open-source de traduction vidéo

    1 057+8Évolution des étoiles sur les 7 derniers jours
  • Reconnaissance vocale hors ligne pour Android avec la bibliothèque Vosk.

    1 056+0Évolution des étoiles sur les 7 derniers jours
  • murmure@Kieirra

    Transcription parole-texte entièrement locale, privée et multiplateforme avec post-traitement par LLM

    1 053+15Évolution des étoiles sur les 7 derniers jours
  • pykaldi@pykaldi

    Un wrapper Python pour Kaldi

    1 040+1Évolution des étoiles sur les 7 derniers jours
  • sherpa@k2-fsa

    Framework de serveur de reconnaissance vocale (speech-to-text) avec Kaldi nouvelle génération.

    984+4Évolution des étoiles sur les 7 derniers jours
  • espresso@freewym

    Espresso : une boîte à outils de reconnaissance vocale neuronale rapide de bout en bout

    939+0Évolution des étoiles sur les 7 derniers jours
  • vocotype-cli@233stone

    VocoType est un outil de saisie vocale local, privé et sécurisé, permettant de convertir la parole en texte en temps réel via des raccourcis clavier. Il prend en charge le MCP de transcription, l'optimisation de texte par IA, les dictionnaires de remplacement personnalisés et la transcription d'enregistrements audio/vidéo.

    928+9Évolution des étoiles sur les 7 derniers jours
  • whisper.api@innovatorved

    Ce projet fournit une API avec gestion des accès utilisateurs pour transcrire la parole en texte à l'aide d'un modèle Whisper ASR affiné et traité.

    914+0Évolution des étoiles sur les 7 derniers jours
  • SmartJavaAI@geekwenjie

    Boîte à outils d'algorithmes d'IA hors ligne gratuite pour Java, prenant en charge la reconnaissance faciale, la détection de vivant, la reconnaissance d'expressions, la détection d'objets, la segmentation d'instances, la détection de piétons, l'OCR, la reconnaissance de plaques d'immatriculation, la reconnaissance de tableaux, ASR+TTS, la traduction automatique, etc. Utilisable via Maven. Supporte PyTorch et Tensorflow, avec intégration de modèles tels que Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR (PPOCRv5) et Whisper.

    908+3Évolution des étoiles sur les 7 derniers jours
  • Easy-Voice-Toolkit@Spr-Aachen

    Une boîte à outils conviviale pour la reconnaissance, la transcription et la conversion vocale, etc.

    873+0Évolution des étoiles sur les 7 derniers jours
  • PPASR@yeyupiaoling

    Reconnaissance vocale chinoise de bout en bout basée sur PaddlePaddle, de l'initiation à la pratique, avec des cas d'étude simples et des projets d'entreprise concrets. Prend en charge les modèles DeepSpeech2, Conformer et Squeezeformer les plus populaires.

    870-1Évolution des étoiles sur les 7 derniers jours
  • GLM-ASR@zai-org

    GLM-ASR-Nano : un modèle de reconnaissance vocale robuste et open source avec 1,5 milliard de paramètres

    854+3Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets