text-to-speech
text-to-speech 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #61★ 1,836+0최근 7일 스타 변화
- #62
앱을 위한 셀프 코딩 시스템 — 안드로이드용 Alan AI SDK
★ 1,807+0최근 7일 스타 변화 - #63★ 1,760+0최근 7일 스타 변화
- #64
앱을 위한 자체 코딩 시스템 — Flutter용 Alan AI SDK
★ 1,756+0최근 7일 스타 변화 - #65
자막 파일을 기반으로 동영상 텍스트를 자동으로 번역한 다음, AI 음성 서비스를 사용하여 자막 타이밍에 맞춰 음성이 동기화된 새로운 더빙 및 번역 오디오 트랙을 생성합니다.
★ 1,746+0최근 7일 스타 변화 - #66
클릭 한 번으로 웹페이지 콘텐츠를 소리내어 읽어주는 멋진 브라우저 확장 프로그램
★ 1,737+0최근 7일 스타 변화 - #67
ExecuTorch 기반의 React Native 기기 내 AI 모델 실행을 위한 선언적 방식.
★ 1,707+0최근 7일 스타 변화 - #68
앱을 위한 셀프 코딩 시스템 — Ionic용 Alan AI SDK
★ 1,649+0최근 7일 스타 변화 - #69
PyTorch를 이용한 비공식 Parallel WaveGAN (+ MelGAN & Multi-band MelGAN & HiFi-GAN & StyleMelGAN)
★ 1,646+0최근 7일 스타 변화 - #70★ 1,622+0최근 7일 스타 변화
- #71
코딩 에이전트를 위한 주제별 → 4K 내레이션 영상 생성. v4.0: ttsCN 엔진 컴포넌트를 통한 모든 TTS (MiniMax 음성 복제, 기본 단어 단위 자막 동기화 등 11개 플랫폼), 매니페스트 기반 자산 엔진, Remotion 컴포지션, 비용 제한형 AI 생성
★ 1,599+0최근 7일 스타 변화 - #72
강력한 텍스트 음성 변환, 이미지 생성, 비디오 생성 API와의 상호작용을 지원하는 공식 MiniMax Model Context Protocol(MCP) 서버.
★ 1,573+0최근 7일 스타 변화 - #73
Apple Silicon을 위한 고성능 OpenAI 및 Anthropic 호환 LLM 추론 서버. 네이티브 MLX, 연속 배치, 멀티모달 모델, MCP 도구 호출 및 Claude Code 지원.
★ 1,557+0최근 7일 스타 변화 - #74
Microsoft의 VibeVoice 텍스트 음성 변환(TTS) 모델을 위한 포괄적인 ComfyUI 통합으로, ComfyUI 워크플로 내에서 직접 고품질의 단일 및 다중 화자 음성 합성을 지원합니다.
★ 1,555+0최근 7일 스타 변화 - #75★ 1,548+0최근 7일 스타 변화
- #76★ 1,542+0최근 7일 스타 변화
- #77
Talking Head (3D): 전신 3D 아바타를 활용한 실시간 립싱크용 JavaScript 클래스입니다.
★ 1,522+0최근 7일 스타 변화 - #78
사람의 목소리를 손쉽게 합성할 수 있는 Python/PyTorch 앱입니다.
★ 1,440+0최근 7일 스타 변화 - #79★ 1,437+0최근 7일 스타 변화
- #80
강력한 Chatterbox TTS 모델을 자체 호스팅하세요. 이 서버는 사용자 친화적인 Web UI, 유연한 API 엔드포인트(OpenAI 호환 포함), 사전 정의된 목소리, 목소리 복제, 대규모 오디오북 수준의 텍스트 처리를 제공합니다. NVIDIA (CUDA), AMD (ROCm) 및 CPU에서 가속화되어 실행됩니다.
★ 1,427+0최근 7일 스타 변화 - #81
🍦 Speech-AI-Forge는 TTS 생성 모델을 중심으로 개발된 프로젝트로, API 서버 및 Gradio 기반 WebUI를 구현합니다.
★ 1,418+0최근 7일 스타 변화 - #82
비디오 동기화 번역. 비디오 더빙
★ 1,413+0최근 7일 스타 변화 - #83
💎 ASR, TTS 및 기타 음성 기술을 위한 접근 가능한 음성 말뭉치(speech corpora) 목록
★ 1,399+0최근 7일 스타 변화 - #84
Apple Silicon Mac에서 LLM 파인튜닝. MLX 네이티브 기반 SFT, DPO, GRPO, Vision, TTS, STT, Embedding, OCR 파인튜닝 지원. Unsloth 호환 API.
★ 1,398+0최근 7일 스타 변화 - #85
[ICASSP 2024] 🍵 Matcha-TTS: 조건부 플로우 매칭을 사용하는 빠른 TTS 아키텍처
★ 1,353+0최근 7일 스타 변화 - #86
[ICLR 2025] 오디오 언어 모델링을 위한 초당 40/75 토큰 성능의 SOTA 이산 음향 코덱 모델
★ 1,317+0최근 7일 스타 변화 - #87★ 1,314+0최근 7일 스타 변화
- #88
StreamSpeech는 오프라인 및 동시 음성 인식, 음성 번역, 음성 합성을 위한 "All in One" 심리스 모델입니다.
★ 1,288+0최근 7일 스타 변화 - #89
다양한 오디오 관련 Neural Network를 위한 웹 UI
★ 1,246+0최근 7일 스타 변화 - #90
이모지 기반 스타일 제어를 지원하는 Flow Matching 방식의 텍스트 음성 변환(TTS) 모델
★ 1,228+0최근 7일 스타 변화