text-to-speech
text-to-speech 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 text-to-speech 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 text-to-speech 태그가 달린 리포지토리예요.
- #1
에이전트가 대화하고, 작업하고, 상주할 수 있도록 유지하는 실시간 음성 런타임. AI 에이전트를 위한 실시간 음성 런타임
★ 2,362 - #2
ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.
★ 2,214 - #3
크리에이터와 AI 에이전트가 동일한 타임라인에서 작업할 수 있는 로컬 우선 오픈소스 영상 편집기
★ 792 - #4
루트 권한이 필요 없는 오픈소스 Android 실시간 화면 번역 도구. 게임, 비주얼 노벨, 만화에 적합하며 온디바이스 및 클라우드 OCR, 오프라인 LLM, 다중 번역 서비스, TTS를 지원하고 화면 위에 직접 번역문을 표시합니다.
★ 786 - #5
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541
- #1
AI 대규모 모델과 자동화된 워크플로우를 활용하여 주제나 키워드에 따라 원클릭으로 고화질 숏폼 비디오 생성.
★ 119,977+1,509최근 7일 스타 변화 - #2
Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4, FLUX 등을 포함한 LLM 및 디퓨전 모델을 실행하고 학습하기 위한 로컬 UI
★ 75,515+337최근 7일 스타 변화 - #3
1분의 음성 데이터로도 훌륭한 TTS 모델을 학습할 수 있습니다! (퓨샷 음성 클로닝)
★ 61,476+138최근 7일 스타 변화 - #4
세계 최초의 오픈 소스 에이전트 기반 동영상 제작 시스템. 12개의 프로덕션 파이프라인, 100개 이상의 도구, 700개 이상의 에이전트 스킬 및 프로덕션 지식 파일. AI 코딩 어시스턴트를 완전한 동영상 제작 스튜디오로 전환하세요.
★ 55,719+1,707최근 7일 스타 변화 - #5★ 45,985+18최근 7일 스타 변화
- #6★ 39,814+9최근 7일 스타 변화
- #7★ 37,419+61최근 7일 스타 변화
- #8
🚀 5초 만에 음성을 복제하여 실시간으로 임의의 음성을 생성합니다
★ 36,912+0최근 7일 스타 변화 - #9★ 36,595+345최근 7일 스타 변화
- #10★ 23,686+109최근 7일 스타 변화
- #11★ 23,426+359최근 7일 스타 변화
- #12★ 19,387+2최근 7일 스타 변화
- #13
영상의 언어를 다른 언어로 번역하고 더빙 및 자막을 삽입합니다.
★ 18,871+38최근 7일 스타 변화 - #14★ 17,476+1최근 7일 스타 변화
- #15
VoiceStudio는 완전 로컬 환경에서 실행되는 오픈 소스 ElevenLabs 대안으로, 646개 언어의 음성 복제, 음성 디자인, 비디오 더빙, 받아쓰기, 전사 및 오디오북 생성을 지원합니다.
★ 14,835+2,880최근 7일 스타 변화 - #16
인터넷 연결 없이 onnxruntime과 차세대 Kaldi를 사용하는 음성 인식, 음성 합성, 화자 분할, 음성 강화, 소스 분리 및 VAD. 임베디드 시스템, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 서버, websocket 서버/클라이언트 지원 및 12개 프로그래밍 언어 지원
★ 14,575+95최근 7일 스타 변화 - #17
ONNX를 통해 네이티브로 실행되는 초고속 온디맨드 다국어 TTS
★ 13,757+20최근 7일 스타 변화 - #18
크리에이터와 개발자를 위한 Gradio WebUI. 주요 TTS(Edge-TTS, kokoro) 및 제로샷 음성 복제(E2 & F5-TTS, CosyVoice)를 지원하며, Whisper 오디오 처리, YouTube 다운로드, Demucs 보컬 분리 및 다국어 번역 기능을 제공합니다.
★ 12,730+54최근 7일 스타 변화 - #19
Microsoft Edge나 Windows, API 키 없이 Python에서 Microsoft Edge의 온라인 텍스트 음성 변환(TTS) 서비스 사용하기
★ 11,847+29최근 7일 스타 변화 - #20
Amphion(/æmˈfaɪən/)은 오디오, 음악 및 음성 생성을 위한 툴킷입니다. 재현 가능한 연구를 지원하고 초보 연구자와 엔지니어가 오디오, 음악 및 음성 생성 연구 및 개발 분야에 쉽게 입문할 수 있도록 돕는 것을 목적으로 합니다.
★ 10,276+1최근 7일 스타 변화 - #21★ 9,949+3최근 7일 스타 변화
- #22
EmotiVoice 😊: 멀티 보이스 및 프롬프트 제어 TTS 엔진
★ 8,522-1최근 7일 스타 변화 - #23
Apple의 MLX 프레임워크를 기반으로 구축된 텍스트 음성 변환(TTS), 음성 텍스트 변환(STT) 및 음성 간 변환(STS) 라이브러리로, Apple Silicon에서 효율적인 음성 분석을 제공합니다.
★ 7,826+23최근 7일 스타 변화 - #24★ 7,616+7최근 7일 스타 변화
- #25★ 6,802+13최근 7일 스타 변화
- #26
Apple Silicon을 위한 온디바이스 음성 AI
★ 6,353+8최근 7일 스타 변화 - #27★ 6,342+3최근 7일 스타 변화
- #28
이 저장소에는 Generative Pre-trained Transformer(GPT), ChatGPT, PaLM 등에 중점을 둔 프롬프트 엔지니어링을 위해 수동으로 선별된 리소스가 포함되어 있습니다.
★ 6,306+7최근 7일 스타 변화 - #29
Silero Models: 매우 간단하게 사용할 수 있는 사전 학습된 텍스트 음성 변환(TTS) 모델
★ 6,084-1최근 7일 스타 변화 - #30★ 5,931+1,108최근 7일 스타 변화