text-to-speech
text-to-speech 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #31★ 5,831+45최근 7일 스타 변화
- #32
오픈소스 음성 AI 플랫폼. Vapi 및 Retell의 셀프 호스팅 대안. 온프레미스, 음성 간(Speech to Speech) 또는 LLM/STT/TTS 전반의 BYOK 지원, 시각적 워크플로우 빌더, MCP 네이티브 및 telephony 지원.
★ 5,568+45최근 7일 스타 변화 - #33
오픈 소스 AI 비디오 로컬라이제이션 도구: YouTube/Bilibili 비디오 다운로드, 자막 인식 및 번역, 음성 복제 더빙, 오디오 트랙 믹싱 및 자막 삽입을 자동으로 수행합니다.
★ 5,404+25최근 7일 스타 변화 - #34
멀티플랫폼 CPU, AMD, NVIDIA GPU PyTorch를 지원하는 Kokoro-82M 텍스트 음성 변환용 Dockerized OpenAI 호환 래퍼; 다중 화자, 음성 믹싱, 자동 스티칭, 캡션 타임스탬프, SSML, 리드어롱 웹 UI
★ 5,399+19최근 7일 스타 변화 - #35
DiffSinger: 얕은 확산 메커니즘을 통한 가창 음성 합성(SVS 및 TTS); AAAI 2022; 공식 코드
★ 4,855+3최근 7일 스타 변화 - #36★ 4,624+0최근 7일 스타 변화
- #37
OpenAI의 Whisper를 거의 실시간으로 구현한 프로젝트
★ 4,246+3최근 7일 스타 변화 - #38
인간과 유사하고 표현력 있는 TTS를 위한 기초 모델
★ 4,203-1최근 7일 스타 변화 - #39
MOSS‑TTS Family는 MOSI.AI와 OpenMOSS 팀이 개발한 오픈소스 음성 및 사운드 생성 모델 패밀리입니다. 고충실도, 고표현력, 복잡한 실제 시나리오를 위해 설계되었으며 안정적인 장문 음성, 다화자 대화, 목소리/캐릭터 디자인, 환경 음향 효과 및 실시간 스트리밍 TTS를 지원합니다.
★ 4,058+18최근 7일 스타 변화 - #40
실시간 텍스트 음성 변환(TTS) 도구
★ 4,021+2최근 7일 스타 변화 - #41
TensorFlowTTS: 텐서플로우 2를 위한 실시간 최첨단 음성 합성 (영어, 프랑스어, 한국어, 중국어, 독일어 지원 및 다른 언어로 쉽게 적용 가능)
★ 3,996+0최근 7일 스타 변화 - #42★ 3,674+14최근 7일 스타 변화
- #43
ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS, CosyVoice, XTTSv2, DIA, Kokoro, OpenVoice, ParlerTTS, Stable Audio, MMS, StyleTTS2, MAGNet, AudioGen, MusicGen, Tortoise, RVC, Vocos, Demucs, SeamlessM4T, Bark 등 다양한 확장 기능을 지원하는 단일 Gradio + React WebUI!
★ 3,250+5최근 7일 스타 변화 - #44
ElevenLabs API를 위한 공식 Python SDK
★ 3,083+2최근 7일 스타 변화 - #45★ 3,061+164최근 7일 스타 변화
- #46★ 2,862+0최근 7일 스타 변화
- #47★ 2,818+1최근 7일 스타 변화
- #48★ 2,628+0최근 7일 스타 변화
- #49
🚀 원클릭 배포(오프라인 통합 패키지 포함)! ChatTTS 기반, 스트리밍 출력, 음성 뽑기, 긴 오디오 생성 및 역할별 읽어주기 지원. 복잡한 설치 없이 간단하고 사용하기 쉽게 제공됩니다.
★ 2,593+0최근 7일 스타 변화 - #50★ 2,583+0최근 7일 스타 변화
- #51★ 2,530+0최근 7일 스타 변화
- #52
베트남어 TTS 및 즉시 음성 복제 • 온디바이스 • 실시간 CPU 추론 • 24kHz 오디오 품질 • 베트남어 텍스트 음성 변환
★ 2,468+21최근 7일 스타 변화 - #53
에이전트가 대화하고, 작업하고, 상주할 수 있도록 유지하는 실시간 음성 런타임. AI 에이전트를 위한 실시간 음성 런타임
★ 2,379+72최근 7일 스타 변화 - #54★ 2,367+0최근 7일 스타 변화
- #55
VALL-E(Zero-Shot Text-To-Speech)의 PyTorch 구현, 데모 재생 링크: https://lifeiteng.github.io/valle/index.html
★ 2,215+0최근 7일 스타 변화 - #56
ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.
★ 2,214+115최근 7일 스타 변화 - #57
7000개 이상의 언어를 지원하는 제어 가능하고 빠른 텍스트 음성 변환(TTS)!
★ 2,207-1최근 7일 스타 변화 - #58
OpenAI, Azure, ElevenLabs를 대체할 수 있는 무료 고품질 텍스트 음성 변환 API 엔드포인트
★ 2,075+5최근 7일 스타 변화 - #59★ 2,048+7최근 7일 스타 변화
- #60
Claude Code를 위한 AI 네이티브 비디오 제작 툴킷
★ 2,036+15최근 7일 스타 변화