text-to-speech
Erfasste Open-Source-Repos mit dem Tag text-to-speech, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit text-to-speech am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit text-to-speech getaggt wurden.
- #1
Eine Echtzeit-Sprachlaufzeitumgebung für KI-Agenten, die sie im Gespräch und aktiv hält.
★ 2.298 - #2
Eine All-in-One-Inferenz-Engine in reinem C++ für Audiomodelle, angetrieben von ggml. Unterstützt TTS, STT, VAD, Sprachkonvertierung, Musikgenerierung und mehr bei hochoptimierter Leistung. Keine Python-Abhängigkeit.
★ 2.128 - #3
Unzensiertes lokales KI-Studio für Windows, Linux und macOS. Installationsfreie GUI für Bildgenerierung, GGUF-LLMs, Text-to-Speech & Speech-to-Text
★ 1.048 - #4
Open-Source-Tool für Android ohne Root-Zugriff zur Echtzeit-Bildschirmübersetzung, geeignet für Spiele, Visual Novels und Mangas. Unterstützt On-Device- und Cloud-OCR, Offline-LLMs, verschiedene Übersetzungsdienste sowie Text-to-Speech (TTS), wobei Übersetzungen direkt auf dem Bildschirm angezeigt werden.
★ 697 - #5
Open-Source-Videoeditor mit Local-First-Ansatz, bei dem Creator und KI-Agenten an derselben Timeline arbeiten.
★ 645
- #1
Generieren Sie HD-Kurzvideos aus einem Thema oder Keyword mit einem automatisierten KI-Workflow.
★ 118.468+4.408Sterne-Änderung der letzten 7 Tage - #2
Lokale UI zum Ausführen und Trainieren von LLMs und Diffusionsmodellen, einschließlich Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX und mehr.
★ 75.178+887Sterne-Änderung der letzten 7 Tage - #3
1 Minute Sprachdaten können auch zum Trainieren eines guten TTS‑Modells verwendet werden! (Few‑Shot‑Sprachklonierung)
★ 61.338+214Sterne-Änderung der letzten 7 Tage - #4
Die weltweit erste Open-Source-Agenten-Video-Produktionsplattform. 12 Produktionspipelines, 100+ Tools, 700+ Agent-Fähigkeiten und Produktionswissensdateien. Verwandeln Sie Ihren AI-Coding-Assistenten in ein vollständiges Video-Produktionsstudio.
★ 54.012+4.684Sterne-Änderung der letzten 7 Tage - #5
🐸💬 - ein Deep-Learning-Toolkit für Text‑zu‑Sprache, erprobt in Forschung und Produktion
★ 45.967+36Sterne-Änderung der letzten 7 Tage - #6★ 39.805+27Sterne-Änderung der letzten 7 Tage
- #7★ 37.358+190Sterne-Änderung der letzten 7 Tage
- #8
🚀Eine Stimme in 5 Sekunden klonen, um beliebiges Speech in Echtzeit zu erzeugen.
★ 36.912-1Sterne-Änderung der letzten 7 Tage - #9
File Browser bietet eine Datei‑Verwaltungs‑Schnittstelle in einem angegebenen Verzeichnis und ermöglicht das Hochladen, Löschen, Vorschauen und Bearbeiten von Dateien.
★ 36.250+293Sterne-Änderung der letzten 7 Tage - #10
Ein industrietaugliches, kontrollierbares und effizientes Zero-Shot-Text-zu-Sprachsystem
★ 23.577+259Sterne-Änderung der letzten 7 Tage - #11
Multilingualer großflächiges Sprachgenerierungsmodell, das Inference, Training und Bereitstellung in vollem Stack ermöglicht.
★ 23.067+215Sterne-Änderung der letzten 7 Tage - #12
Ein TTS-Modell, das in der Lage ist, ultrarealistische Dialoge in einem Durchgang zu erzeugen.
★ 19.385+12Sterne-Änderung der letzten 7 Tage - #13
Videos von einer Sprache in eine andere übersetzen und Synchronisation sowie Untertitel einbetten.
★ 18.833+65Sterne-Änderung der letzten 7 Tage - #14★ 17.475+22Sterne-Änderung der letzten 7 Tage
- #15
Spracherkennung, Sprachsynthese, Sprecher-Diarisierung, Sprachverbesserung, Quellentrennung und VAD unter Verwendung von Kaldi der nächsten Generation mit onnxruntime ohne Internetverbindung. Unterstützt eingebettete Systeme, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64-Server, WebSocket-Server/Client sowie 12 Programmiersprachen.
★ 14.480+169Sterne-Änderung der letzten 7 Tage - #16
Blitzschnelles, gerätebasiertes, mehrsprachiges TTS — läuft nativ über ONNX.
★ 13.737+23Sterne-Änderung der letzten 7 Tage - #17
Gradio WebUI für Creator und Entwickler mit wichtigen TTS-Funktionen (Edge-TTS, kokoro) und Zero-Shot Voice Cloning (E2 & F5-TTS, CosyVoice), inklusive Whisper-Audioverarbeitung, YouTube-Download, Demucs-Gesangsisolierung und mehrsprachiger Übersetzung.
★ 12.676+100Sterne-Änderung der letzten 7 Tage - #18
VoiceStudio ist die Open-Source- und vollständig lokale Alternative zu ElevenLabs — Stimmenklonen, Stimmen-Design, Videodubbing, Diktat, Transkription und Erstellung von Hörbüchern in 646 Sprachen.
★ 11.955+853Sterne-Änderung der letzten 7 Tage - #19
Nutze den Online-Text-to-Speech-Dienst von Microsoft Edge aus Python, OHNE Microsoft Edge, Windows oder einen API-Key zu benötigen
★ 11.818+49Sterne-Änderung der letzten 7 Tage - #20
Amphion (/æmˈfaɪən/) ist ein Toolkit zur Audio-, Musik- und Sprachgenerierung. Sein Zweck ist es, reproduzierbare Forschung zu unterstützen und jüngeren Forschern sowie Ingenieuren den Einstieg in die Forschung und Entwicklung zur Audio-, Musik- und Sprachgenerierung zu erleichtern.
★ 10.275+17Sterne-Änderung der letzten 7 Tage - #21★ 9.946+15Sterne-Änderung der letzten 7 Tage
- #22
EmotiVoice 😊: Eine Multi-Voice- und Prompt-gesteuerte TTS-Engine
★ 8.523+2Sterne-Änderung der letzten 7 Tage - #23
Eine auf Apples MLX-Framework basierende Text-to-Speech (TTS)-, Speech-to-Text (STT)- und Speech-to-Speech (STS)-Bibliothek für effiziente Sprachanalyse auf Apple Silicon.
★ 7.803+31Sterne-Änderung der letzten 7 Tage - #24
Hochwertige, mehrsprachige Text-to-Speech-Bibliothek von MyShell.ai. Unterstützt Englisch, Spanisch, Französisch, Chinesisch, Japanisch und Koreanisch.
★ 7.609+20Sterne-Änderung der letzten 7 Tage - #25
eSpeak NG ist ein Open-Source-Sprachsynthesizer, der mehr als hundert Sprachen und Akzente unterstützt.
★ 6.789+37Sterne-Änderung der letzten 7 Tage - #26
On-Device-Sprach-KI für Apple Silicon
★ 6.345+11Sterne-Änderung der letzten 7 Tage - #27
StyleTTS 2: Annäherung an menschliche Sprachsynthese durch Style Diffusion und adversariales Training mit großen Sprachmodellen für Sprache
★ 6.339+8Sterne-Änderung der letzten 7 Tage - #28
Dieses Repository enthält handverlesene Ressourcen für Prompt Engineering mit Schwerpunkt auf Generative Pre-trained Transformer (GPT), ChatGPT, PaLM usw.
★ 6.299+27Sterne-Änderung der letzten 7 Tage - #29
Silero Models: Vorab trainierte Text-to-Speech-Modelle, denkbar einfach gestaltet
★ 6.085+11Sterne-Änderung der letzten 7 Tage - #30★ 5.786+43Sterne-Änderung der letzten 7 Tage