stt
Erfasste Open-Source-Repos mit dem Tag stt, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit stt am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit stt getaggt wurden.
- #1
Ausgabenzähler und Budget-Limitierung für KI-Sprachagenten. Erfasst STT + TTS + LLM + Telefonie pro Anruf (Pipecat, LiveKit – Python & TypeScript). Stoppt den nächsten Turn, bevor das Budget überschritten wird. Lokal, kein Konto, keine Telemetrie. Entwickelt von Floe – Kostenkontrolle für Voice AI.
★ 434
- #1
Dein KI‑Zweitgehirn. Selbst‑hostbar. Erhalte Antworten aus dem Web oder deinen Dokumenten. Erstelle benutzerdefinierte Agents, plane Automatisierungen, führe tiefgehende Forschung durch. Transformiere jedes Online‑ oder lokale LLM in deine persönliche, autonome KI (gpt, claude, gemini, llama, qwen, mistral). Loslegen – kostenlos.
★ 36.787+149Sterne-Änderung der letzten 7 Tage - #2
Offline-Spracherkennungs-API für Android, iOS, Raspberry Pi und Server mit Python, Java, C# und Node.
★ 15.084+17Sterne-Änderung der letzten 7 Tage - #3
Sprach-zu-Text, Absichtserkennung (Intent Recognition) und Text-zu-Sprache mit sehr geringer Latenz zum Erstellen von Sprachagenten und -schnittstellen
★ 10.964+52Sterne-Änderung der letzten 7 Tage - #4
Open Vision Agents von Stream. Erstellen Sie schnell Sprach- und Bild-Agenten mit beliebigen Modell- oder Video-Anbietern. Nutzt das Edge-Netzwerk von Stream für ultra-gringe Latenzen.
★ 8.104+9Sterne-Änderung der letzten 7 Tage - #5
Spracherkennungstool für Text / Ein lokal laufendes Offline-Tool zur Audio- und Video-Untertitelung, das JSON-, SRT- und Reintextformate ausgibt.
★ 4.771+7Sterne-Änderung der letzten 7 Tage - #6
Transkribieren Sie jegliches Audio in Text, übersetzen und bearbeiten Sie Untertitel 100% lokal mit einer Web-Benutzeroberfläche. Unterstützt durch Whisper-Modelle!
★ 3.067+5Sterne-Änderung der letzten 7 Tage - #7
🐸STT – Das Deep-Learning-Toolkit für Speech-to-Text. Das Trainieren und Bereitstellen von STT-Modellen war noch nie so einfach.
★ 2.605+1Sterne-Änderung der letzten 7 Tage - #8
🎙 Spracherkennung mit dem Deep-Learning-Framework TensorFlow und Sequence-to-Sequence-neuronalen Netzen
★ 2.173+1Sterne-Änderung der letzten 7 Tage - #9
Echtzeit-Sprach-KI-Spielzeug mit über 100 Modellen auf Arduino ESP32 mit sicheren WebSockets und Edge-Funktionen für KI-Begleiter und -Geräte
★ 1.937+4Sterne-Änderung der letzten 7 Tage - #10
Lernen Sie Ava kennen, den WhatsApp Agent
★ 1.673+1Sterne-Änderung der letzten 7 Tage - #11
Speech Note Linux-App. Notizen erstellen, lesen und übersetzen mit Offline-Spracherkennung (Speech-to-Text), Sprachsynthese (Text-to-Speech) und maschineller Übersetzung.
★ 1.620+7Sterne-Änderung der letzten 7 Tage - #12
Dicio-Assistenten-App für Android
★ 1.462+17Sterne-Änderung der letzten 7 Tage - #13
🍦 Speech-AI-Forge ist ein rund um TTS-Generierungsmodelle entwickeltes Projekt, das einen API-Server und ein Gradio-basiertes WebUI implementiert.
★ 1.418+4Sterne-Änderung der letzten 7 Tage - #14
Synchronisierte Übersetzung für Videos. Videovertonung
★ 1.413+5Sterne-Änderung der letzten 7 Tage - #15
💎 Eine Liste barrierefreier Sprachkorpora für ASR, TTS und andere Sprachtechnologien
★ 1.399+0Sterne-Änderung der letzten 7 Tage - #16
Eine Java-Enterprise-Managementplattform für Xiaozhi ESP32, die eine integrierte Frontend- und Backend- sowie Serverlösung für Gerätemonitoring, Stimmanpassung, Rollenwechsel und Chat-Protokollverwaltung bietet
★ 1.337+0Sterne-Änderung der letzten 7 Tage - #17
Gp.nvim (GPT prompt) Neovim AI-Plugin: ChatGPT-Sitzungen & instruierbare Text-/Code-Operationen & Spracherkennung [OpenAI, Ollama, Anthropic, ..]
★ 1.320+0Sterne-Änderung der letzten 7 Tage - #18
Echtzeit-Sprachübersetzung — macOS & Windows, kostenlose TTS, kein Server, nur Ihre API-Schlüssel
★ 1.277+3Sterne-Änderung der letzten 7 Tage - #19
Zwei-Wege-Echtzeit-Sprachübersetzung für zweisprachige Meetings – erkennt automatisch die gesprochene Sprache und übersetzt in beide Richtungen, in der Cloud oder vollständig offline auf dem Gerät. Desktop (Windows · macOS · Linux) + Browser-Erweiterung (Chrome · Edge) für Zoom, Meet, Teams & jede beliebige App.
★ 1.164+37Sterne-Änderung der letzten 7 Tage - #20
NobodyWho ist eine Inferenz-Engine, mit der Sie LLMs lokal und effizient auf jedem Gerät ausführen können.
★ 1.081+11Sterne-Änderung der letzten 7 Tage - #21
🎤 Lobe TTS – Eine hochwertige und zuverlässige TTS/STT-Bibliothek für Server und Browser
★ 805+2Sterne-Änderung der letzten 7 Tage - #22
🎙️ Ein intelligenter Sprach-Produktivitätsassistent, der Sprache in sauberen Text, nützliche Aktionen und strukturiertes Wissen verwandelt. Er hilft Benutzern, Ideen zu erfassen, natürlich zu kommunizieren, wiederkehrende Aufgaben zu automatisieren und über verschiedene Apps und Workflows hinweg produktiv zu bleiben.
★ 801+6Sterne-Änderung der letzten 7 Tage - #23
Sprache zu Text zu Sprache. Song wird jetzt abgespielt. Sendet Text als OSC-Nachrichten an VRChat zur Anzeige auf dem Avatar. (STTTS) (Sprache zu TTS) (VRC-STT-System) (VTuber-TTS)
★ 799+1Sterne-Änderung der letzten 7 Tage - #24
Ein modulares Swift-SDK zur Audioverarbeitung mit MLX auf Apple Silicon
★ 768+5Sterne-Änderung der letzten 7 Tage - #25
Ausführen eines Speech-to-Text-Modells (whisper.cpp) in Unity3d auf Ihrem lokalen Computer.
★ 750-2Sterne-Änderung der letzten 7 Tage - #26
MLX Omni Server ist ein lokaler Inferenz-Server, der auf Apples MLX-Framework basiert und speziell für Apple Silicon (M-Series) Chips entwickelt wurde. Er implementiert OpenAI-kompatible API-Endpunkte und ermöglicht so eine nahtlose Integration mit bestehenden OpenAI SDK Clients, während er die Leistung der lokalen ML-Inferenz nutzt.
★ 741+5Sterne-Änderung der letzten 7 Tage - #27★ 671+0Sterne-Änderung der letzten 7 Tage
- #28
:speech_balloon: /so.nus/ STT (Speech-to-Text) für Node mit Offline-Hotword-Erkennung
★ 638+0Sterne-Änderung der letzten 7 Tage - #29
Eine React-Komponente, die das Korrigieren automatischer Transkriptionen von Audio und Video einfacher und schneller macht. Von BBC News Labs. - In Arbeit
★ 621+0Sterne-Änderung der letzten 7 Tage - #30
C++ ggml Runtime-Hub für mehrsprachige ASR- und TTS-Modelle: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2 sowie universelles Forced Alignment und mehr.
★ 599+26Sterne-Änderung der letzten 7 Tage