text-to-speech
Erfasste Open-Source-Repos mit dem Tag text-to-speech, sortiert nach Sternen.
- #61★ 1.836+0Sterne-Änderung der letzten 7 Tage
- #62
Das selbstkodierende System für Ihre App — Alan AI SDK für Android
★ 1.807+0Sterne-Änderung der letzten 7 Tage - #63★ 1.760+0Sterne-Änderung der letzten 7 Tage
- #64
Das Self-Coding-System für Ihre App — Alan AI SDK für Flutter
★ 1.756+0Sterne-Änderung der letzten 7 Tage - #65
Übersetzt automatisch den Text eines Videos basierend auf einer Untertiteldatei und erstellt anschließend mithilfe von KI-Sprachdiensten eine neu synchronisierte und übersetzte Audiospur, die an die Timings der Untertitel angepasst ist.
★ 1.746+0Sterne-Änderung der letzten 7 Tage - #66
Eine großartige Browser-Erweiterung, die Webseiteninhalte mit einem Klick vorliest
★ 1.737+0Sterne-Änderung der letzten 7 Tage - #67
Deklarative Möglichkeit, KI-Modelle in React Native auf dem Gerät auszuführen, angetrieben von ExecuTorch.
★ 1.707+0Sterne-Änderung der letzten 7 Tage - #68
Das Self-Coding-System für Ihre App — Alan AI SDK für Ionic
★ 1.649+0Sterne-Änderung der letzten 7 Tage - #69
Inoffizielles Parallel WaveGAN (+ MelGAN & Multi-band MelGAN & HiFi-GAN & StyleMelGAN) mit PyTorch
★ 1.646+0Sterne-Änderung der letzten 7 Tage - #70
Speech Note Linux-App. Notizen erstellen, lesen und übersetzen mit Offline-Spracherkennung (Speech-to-Text), Sprachsynthese (Text-to-Speech) und maschineller Übersetzung.
★ 1.622+0Sterne-Änderung der letzten 7 Tage - #71
Thema → 4K-kommentiertes Video für Coding-Agenten. v4.0: Alle TTS über die ttsCN-Engine-Komponente (11 Plattformen inkl. MiniMax-Sprachklonierung, native Wort-Level-Untertitel-Synchronisierung), Manifest-basiertes Asset Engine, Remotion-Komposition, kostenkontrollierte KI-Generierung
★ 1.599+0Sterne-Änderung der letzten 7 Tage - #72
Offizieller MiniMax Model Context Protocol (MCP)-Server, der die Interaktion mit leistungsstarken APIs für Text-to-Speech, Bildgenerierung und Videogenerierung ermöglicht.
★ 1.573+0Sterne-Änderung der letzten 7 Tage - #73
Leistungsstarker, mit OpenAI und Anthropic kompatibler LLM-Inferenzserver für Apple Silicon. Nativer MLX, Continuous Batching, multimodale Modelle, MCP-Tool-Aufrufe und Claude-Code-Unterstützung.
★ 1.557+0Sterne-Änderung der letzten 7 Tage - #74
Eine umfassende ComfyUI-Integration für das VibeVoice Text-to-Speech-Modell von Microsoft, die eine hochwertige Sprachsynthese für einzelne und mehrere Sprecher direkt in Ihren ComfyUI-Workflows ermöglicht.
★ 1.555+0Sterne-Änderung der letzten 7 Tage - #75★ 1.548+0Sterne-Änderung der letzten 7 Tage
- #76
Mit dem Mac sprechen, Dokumente abfragen, keine Cloud erforderlich. Sprach-KI auf dem Gerät + RAG
★ 1.542+0Sterne-Änderung der letzten 7 Tage - #77
Talking Head (3D): Eine JavaScript-Klasse für Echtzeit-Lip-Sync mit ganzkörperlichen 3D-Avataren.
★ 1.522+0Sterne-Änderung der letzten 7 Tage - #78
Eine Python/PyTorch-App zur einfachen Synthese menschlicher Stimmen
★ 1.440+0Sterne-Änderung der letzten 7 Tage - #79★ 1.437+0Sterne-Änderung der letzten 7 Tage
- #80
Hosten Sie das leistungsstarke Chatterbox TTS-Modell selbst. Dieser Server bietet eine benutzerfreundliche Web-UI, flexible API-Endpunkte (inkl. OpenAI-Kompatibilität), vordefinierte Stimmen, Klonen von Stimmen und Textverarbeitung im Umfang großer Hörbücher. Läuft beschleunigt auf NVIDIA (CUDA), AMD (ROCm) und CPU.
★ 1.427+0Sterne-Änderung der letzten 7 Tage - #81
🍦 Speech-AI-Forge ist ein rund um TTS-Generierungsmodelle entwickeltes Projekt, das einen API-Server und ein Gradio-basiertes WebUI implementiert.
★ 1.418+0Sterne-Änderung der letzten 7 Tage - #82
Synchronisierte Übersetzung für Videos. Videovertonung
★ 1.413+0Sterne-Änderung der letzten 7 Tage - #83
💎 Eine Liste barrierefreier Sprachkorpora für ASR, TTS und andere Sprachtechnologien
★ 1.399+0Sterne-Änderung der letzten 7 Tage - #84
Fine-Tuning von LLMs auf Ihrem Mac mit Apple Silicon. SFT-, DPO-, GRPO-, Vision-, TTS-, STT-, Embedding- und OCR-Fine-Tuning – nativ auf MLX. Unsloth-kompatible API.
★ 1.398+0Sterne-Änderung der letzten 7 Tage - #85
[ICASSP 2024] 🍵 Matcha-TTS: Eine schnelle TTS-Architektur mit Conditional Flow Matching
★ 1.353+0Sterne-Änderung der letzten 7 Tage - #86
[ICLR 2025] SOTA diskrete Audio-Codec-Modelle mit 40/75 Tokens pro Sekunde für Audio-Sprachmodellierung
★ 1.317+0Sterne-Änderung der letzten 7 Tage - #87
Offline-Inferenz-Engine für Kunst, Echtzeit-Sprachkonversationen, LLM-gestützte Chatbots und automatisierte Workflows
★ 1.314+0Sterne-Änderung der letzten 7 Tage - #88
StreamSpeech ist ein All-in-One-Modell für nahtlose Offline- und Simultanspracherkennung, -sprachübersetzung und -sprachsynthese.
★ 1.288+0Sterne-Änderung der letzten 7 Tage - #89
Ein Web-UI für verschiedene audiorelevante neuronale Netze
★ 1.246+0Sterne-Änderung der letzten 7 Tage - #90
Ein Flow Matching-basiertes Text-to-Speech-Modell mit Emoji-gesteuerter Stilkontrolle
★ 1.228+0Sterne-Änderung der letzten 7 Tage