Zum Hauptinhalt springen
buildradar
Sign in
Thema · speech-to-text

speech-to-text

Erfasste Open-Source-Repos mit dem Tag speech-to-text, sortiert nach Sternen.

152 Repos
  • dograh@dograh-hq

    Open-Source-Sprach-KI-Plattform. Self-Hosted-Alternative zu Vapi und Retell. On-Premise, BYOK für Speech-to-Speech oder LLM/STT/TTS, mit visuellem Workflow-Builder, MCP-nativ und Telefonie-Unterstützung.

    5.568+45Sterne-Änderung der letzten 7 Tage
  • YouDub-webui@liuzhao1225

    Open-Source-KI-Tool zur Videolokalisierung: automatischer Download von YouTube/Bilibili-Videos, Untertitelung und Übersetzung, Stimmklon-Synchronisation, Audiospur-Mischung und Untertitel-Einbettung.

    5.404+25Sterne-Änderung der letzten 7 Tage
  • stt@jianchang512

    Spracherkennungstool für Text / Ein lokal laufendes Offline-Tool zur Audio- und Video-Untertitelung, das JSON-, SRT- und Reintextformate ausgibt.

    4.780+9Sterne-Änderung der letzten 7 Tage
  • whisper-jax@sanchit-gandhi

    JAX-Implementierung des Whisper-Modells von OpenAI für eine bis zu 70-fache Beschleunigung auf TPUs.

    4.679-1Sterne-Änderung der letzten 7 Tage
  • fastrtc@gradio-app

    Die Python-Bibliothek für Echtzeitkommunikation

    4.624+0Sterne-Änderung der letzten 7 Tage
  • auto-subs@tmoroney

    Untertitelerzeugung auf dem Gerät, die sich direkt mit DaVinci Resolve, Premiere und After Effects verbindet.

    4.122+20Sterne-Änderung der letzten 7 Tage
  • Leichtgewichtige und leistungsstarke Echtzeit-Audio-/Sprachübersetzungstool basierend auf Windows LiveCaptions.

    3.637+33Sterne-Änderung der letzten 7 Tage
  • openless@Open-Less

    Taste gedrückt halten, sprechen, loslassen – KI-optimierter Text erscheint an Ihrem Cursor in jeder App. Open-Source-Spracheingabe für macOS & Windows.

    3.403+44Sterne-Änderung der letzten 7 Tage
  • OpenAI Whisper ASR Webservice API

    3.328+2Sterne-Änderung der letzten 7 Tage
  • Whisper & Faster-Whisper Standalone-Executables für alle, die sich nicht mit Python herumschlagen möchten.

    3.171+2Sterne-Änderung der letzten 7 Tage
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni ist ein latenzarmes und qualitativ hochwertiges End-to-End-Sprachinteraktionsmodell auf Basis von Llama-3.1-8B-Instruct mit dem Ziel, Sprachfunktionen auf GPT-4o-Niveau zu erreichen.

    3.147+1Sterne-Änderung der letzten 7 Tage
  • willow@HeyWillow

    Open-Source-, lokale und selbst gehostete Sprachassistenten-Alternative als Konkurrenz zu Amazon Echo/Google Home

    3.101+1Sterne-Änderung der letzten 7 Tage
  • whishper@pluja

    Transkribieren Sie jegliches Audio in Text, übersetzen und bearbeiten Sie Untertitel 100% lokal mit einer Web-Benutzeroberfläche. Unterstützt durch Whisper-Modelle!

    3.068+2Sterne-Änderung der letzten 7 Tage
  • lingvo@tensorflow

    Lingvo

    2.864+0Sterne-Änderung der letzten 7 Tage
  • whisper-timestamped@linto-ai

    Mehrsprachige automatische Spracherkennung mit wortgenauen Zeitstempeln und Konfidenzwerten

    2.842+1Sterne-Änderung der letzten 7 Tage
  • vexa@Vexa-ai

    Open-Source-Meeting-Transkriptions-API für Google Meet, Microsoft Teams & Zoom. Automatisch beitretende Bots, Echtzeit-WebSocket-Transkripte, MCP-Server für KI-Agenten. Selbst gehostet oder als gehostetes SaaS.

    2.741+15Sterne-Änderung der letzten 7 Tage
  • FluidAudio@FluidInference

    Modernste CoreML-Audiomodelle in Ihren Apps — Text-to-Speech, Speech-to-Text, Spracherkennung und Sprecherdiarisierung. In Swift, angetrieben von SOTA Open Source.

    2.723+13Sterne-Änderung der letzten 7 Tage
  • pluely@iamsrikanthnani

    Die Open-Source-Alternative zu Cluely – Ein blitzschneller, datenschutzorientierter KI-Assistent, der unbemerkt bei Meetings, Interviews und Gesprächen unterstützt. Mit Tauri für native Performance entwickelt, nur 10 MB groß. In Videoanrufen, Bildschirmfreigaben und Aufnahmen völlig unsichtbar.

    2.619+12Sterne-Änderung der letzten 7 Tage
  • STT@coqui-ai

    🐸STT – Das Deep-Learning-Toolkit für Speech-to-Text. Das Trainieren und Bereitstellen von STT-Modellen war noch nie so einfach.

    2.606+1Sterne-Änderung der letzten 7 Tage
  • foundry-local@microsoft
    2.537+6Sterne-Änderung der letzten 7 Tage
  • awesome-whisper@sindresorhus

    🔊 Awesome-Liste für Whisper – ein von OpenAI entwickeltes, KI-gestütztes Open-Source-Spracherkennungssystem

    2.375+1Sterne-Änderung der letzten 7 Tage
  • openscreen@getopenscreen

    Bildschirminhalt aufnehmen, Demo veröffentlichen. Kostenlos und Open Source, GPU-beschleunigt, keine Wasserzeichen, keine Abonnements. Windows, macOS, Linux. Aktiv gewartet.

    2.287+122Sterne-Änderung der letzten 7 Tage
  • ququ@yan5xu

    Open-Source und kostenlose Alternative zu Wispr Flow | Desktop-Sprach-Workflow der nächsten Generation für Chinesisch, integriert mit lokalem FunASR-Modell und konfigurierbaren großen Sprachmodellen.

    2.278+5Sterne-Änderung der letzten 7 Tage
  • audio.cpp@0xShug0

    Eine All-in-One-Inferenz-Engine in reinem C++ für Audiomodelle, angetrieben von ggml. Unterstützt TTS, STT, VAD, Sprachkonvertierung, Musikgenerierung und mehr bei hochoptimierter Leistung. Keine Python-Abhängigkeit.

    2.214+115Sterne-Änderung der letzten 7 Tage
  • WhisperJAV@meizhong986

    ASR/STT-Untertitelgenerator. Verwendet Qwen3-ASR, lokale LLM, Whisper, TEN-VAD. Rauschrobust für JAV

    2.196+17Sterne-Änderung der letzten 7 Tage
  • 🎙 Spracherkennung mit dem Deep-Learning-Framework TensorFlow und Sequence-to-Sequence-neuronalen Netzen

    2.173+0Sterne-Änderung der letzten 7 Tage
  • soloud@jarikomppa

    Kostenlose, einfache und portable Audio-Engine für Spiele

    2.170+3Sterne-Änderung der letzten 7 Tage
  • vad@ricky0123

    Sprachaktivierungserkennung (VAD) für den Browser mit einer einfachen API

    2.046+1Sterne-Änderung der letzten 7 Tage
  • audapolis@bugbakery

    Ein Editor für gesprochenes Audio mit automatischer Transkription

    1.892+2Sterne-Änderung der letzten 7 Tage
  • transcribe.cpp@handy-computer

    ggml Speech-to-Text Inferenz für über 16 Modellfamilien

    1.872+19Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen