Aller au contenu principal
buildradar
Se connecter
Sujet · speech-to-text

speech-to-text

Dépôts open source suivis étiquetés speech-to-text, triés par étoiles.

152 dépôts
  • dograh@dograh-hq

    Plateforme IA vocale open source. Alternative auto-hébergée à Vapi et Retell. Déploiement sur site, BYOK pour Speech-to-Speech ou LLM/STT/TTS, avec un constructeur de workflow visuel, support natif MCP et téléphonie.

    5 568+0Évolution des étoiles sur les 7 derniers jours
  • YouDub-webui@liuzhao1225

    Outil open source de localisation vidéo par IA : automatise le téléchargement de vidéos YouTube/Bilibili, la reconnaissance et la traduction de sous-titres, le clonage vocal, le mixage audio et l'incrustation de sous-titres.

    5 404+0Évolution des étoiles sur les 7 derniers jours
  • stt@jianchang512

    Outil de reconnaissance vocale hors ligne pour générer des sous-titres au format JSON, SRT ou texte brut.

    4 780+0Évolution des étoiles sur les 7 derniers jours
  • whisper-jax@sanchit-gandhi

    Implémentation JAX du modèle Whisper d'OpenAI, offrant jusqu'à 70x plus de vitesse sur TPU.

    4 679+0Évolution des étoiles sur les 7 derniers jours
  • fastrtc@gradio-app

    La bibliothèque Python pour la communication en temps réel

    4 624+0Évolution des étoiles sur les 7 derniers jours
  • auto-subs@tmoroney

    Génération de sous-titres sur l'appareil, avec intégration directe pour DaVinci Resolve, Premiere et After Effects.

    4 122+0Évolution des étoiles sur les 7 derniers jours
  • Outil de traduction audio/parole en temps réel léger et puissant basé sur Windows LiveCaptions.

    3 637+0Évolution des étoiles sur les 7 derniers jours
  • openless@Open-Less

    Maintenez une touche, parlez, relâchez : du texte optimisé par IA apparaît à votre curseur dans n'importe quelle application. Saisie vocale open-source pour macOS et Windows.

    3 403+0Évolution des étoiles sur les 7 derniers jours
  • API de service web ASR pour OpenAI Whisper.

    3 328+0Évolution des étoiles sur les 7 derniers jours
  • Exécutables autonomes pour Whisper et Faster-Whisper pour ceux qui ne souhaitent pas utiliser Python.

    3 171+0Évolution des étoiles sur les 7 derniers jours
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni est un modèle d'interaction vocale de bout en bout à faible latence et haute qualité, basé sur Llama-3.1-8B-Instruct, visant des capacités vocales au niveau de GPT-4o.

    3 147+0Évolution des étoiles sur les 7 derniers jours
  • willow@HeyWillow

    Alternative open source, locale et auto-hébergée aux assistants vocaux Amazon Echo et Google Home.

    3 101+0Évolution des étoiles sur les 7 derniers jours
  • whishper@pluja

    Transcrivez n'importe quel audio en texte, traduisez et modifiez des sous-titres 100 % localement avec une interface web. Propulsé par les modèles whisper !

    3 068+0Évolution des étoiles sur les 7 derniers jours
  • lingvo@tensorflow

    Lingvo

    2 864+0Évolution des étoiles sur les 7 derniers jours
  • whisper-timestamped@linto-ai

    Reconnaissance vocale automatique multilingue avec horodatages au niveau du mot et indices de confiance

    2 842+0Évolution des étoiles sur les 7 derniers jours
  • vexa@Vexa-ai

    API open-source de transcription de réunions pour Google Meet, Microsoft Teams et Zoom. Inclut des bots de connexion automatique, des transcriptions WebSocket en temps réel et un serveur MCP pour les agents IA. Auto-hébergement ou SaaS disponible.

    2 741+0Évolution des étoiles sur les 7 derniers jours
  • FluidAudio@FluidInference

    Modèles audio CoreML de pointe dans vos applications : synthèse vocale, reconnaissance vocale, détection d'activité vocale et diarisation des locuteurs. En Swift, propulsé par des solutions open source SOTA.

    2 723+0Évolution des étoiles sur les 7 derniers jours
  • pluely@iamsrikanthnani

    L'alternative open source à Cluely - Un assistant IA ultra-rapide axé sur la confidentialité, fonctionnant en toute transparence pendant les réunions, entretiens et conversations sans être détecté. Construit avec Tauri pour des performances natives, seulement 10 Mo. Totalement indétectable lors des appels vidéo, partages d'écran et enregistrements.

    2 619+0Évolution des étoiles sur les 7 derniers jours
  • STT@coqui-ai

    🐸STT - La boîte à outils de deep learning pour la conversion parole-texte. L'entraînement et le déploiement de modèles STT n'ont jamais été aussi simples.

    2 606+0Évolution des étoiles sur les 7 derniers jours
  • foundry-local@microsoft
    2 537+0Évolution des étoiles sur les 7 derniers jours
  • awesome-whisper@sindresorhus

    Liste de ressources pour Whisper, un système de reconnaissance vocale open-source propulsé par l'IA développé par OpenAI

    2 375+0Évolution des étoiles sur les 7 derniers jours
  • openscreen@getopenscreen

    Enregistrez votre écran, publiez une démo. Gratuit et open source, accéléré par GPU, sans filigrane ni abonnement. Disponible sur Windows, macOS et Linux. Activement maintenu.

    2 287+0Évolution des étoiles sur les 7 derniers jours
  • ququ@yan5xu

    Alternative open-source et gratuite à Wispr Flow | Flux de travail vocal de bureau chinois de nouvelle génération intégrant le modèle local FunASR et des modèles de langage configurables

    2 278+0Évolution des étoiles sur les 7 derniers jours
  • audio.cpp@0xShug0

    Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.

    2 214+0Évolution des étoiles sur les 7 derniers jours
  • WhisperJAV@meizhong986

    Générateur de sous-titres ASR/STT. Utilise Qwen3-ASR, LLM local, Whisper et TEN-VAD. Robuste face au bruit pour JAV.

    2 196+0Évolution des étoiles sur les 7 derniers jours
  • 🎙 Reconnaissance vocale utilisant le framework de deep learning TensorFlow et des réseaux de neurones sequence-to-sequence

    2 173+0Évolution des étoiles sur les 7 derniers jours
  • soloud@jarikomppa

    Moteur audio gratuit, simple et portable pour les jeux.

    2 170+0Évolution des étoiles sur les 7 derniers jours
  • vad@ricky0123

    Détecteur d'activité vocale (VAD) pour navigateur avec une API simple.

    2 046+0Évolution des étoiles sur les 7 derniers jours
  • audapolis@bugbakery

    Un éditeur pour l'audio parlé avec transcription automatique

    1 892+0Évolution des étoiles sur les 7 derniers jours
  • transcribe.cpp@handy-computer

    Inférence speech-to-text ggml pour plus de 16 familles de modèles

    1 872+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets