speech-to-text
speech-to-text 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 speech-to-text 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 speech-to-text 태그가 달린 리포지토리예요.
- #1
ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.
★ 2,214 - #2
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 1,018 - #3
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 547 - #4
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 544 - #5
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 502
- #1
C/C++로 포팅된 OpenAI의 Whisper 모델
★ 53,389+0최근 7일 스타 변화 - #2★ 30,916+0최근 7일 스타 변화
- #3
프라이버시를 최우선으로 하는 AI 미팅 어시스턴트입니다. Rust 기반으로 제작되었으며, 4배 더 빠른 Parakeet/Whisper 실시간 전사, 화자 분할, Ollama 요약 기능을 제공합니다. 100% 로컬 처리로 클라우드가 필요하지 않습니다. Meetily는 macOS 및 Windows를 위한 최고의 자체 호스팅 오픈 소스 AI 회의록 작성 도구입니다.
★ 30,252+0최근 7일 스타 변화 - #4★ 25,859+0최근 7일 스타 변화
- #5
CTranslate2를 사용한 더 빠른 Whisper 전사
★ 25,206+0최근 7일 스타 변화 - #6★ 23,864+0최근 7일 스타 변화
- #7
YC (S26) | 오픈 컴퓨터 히스토리 | 로컬에서 화면을 지속적으로 녹화하고 에이전트(Claude, Codex, Openclaw, Hermes, Runner 등)에 컨텍스트 제공
★ 21,376+0최근 7일 스타 변화 - #8★ 20,136+0최근 7일 스타 변화
- #9
영상의 언어를 다른 언어로 번역하고 더빙 및 자막을 삽입합니다.
★ 18,871+0최근 7일 스타 변화 - #10★ 17,476+0최근 7일 스타 변화
- #11★ 15,474+0최근 7일 스타 변화
- #12★ 15,101+0최근 7일 스타 변화
- #13
VoiceStudio는 완전 로컬 환경에서 실행되는 오픈 소스 ElevenLabs 대안으로, 646개 언어의 음성 복제, 음성 디자인, 비디오 더빙, 받아쓰기, 전사 및 오디오북 생성을 지원합니다.
★ 14,835+0최근 7일 스타 변화 - #14
인터넷 연결 없이 onnxruntime과 차세대 Kaldi를 사용하는 음성 인식, 음성 합성, 화자 분할, 음성 강화, 소스 분리 및 VAD. 임베디드 시스템, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 서버, websocket 서버/클라이언트 지원 및 12개 프로그래밍 언어 지원
★ 14,575+0최근 7일 스타 변화 - #15
오픈 소스 모델로 음성 에이전트 구축
★ 13,015+0최근 7일 스타 변화 - #16
크리에이터와 개발자를 위한 Gradio WebUI. 주요 TTS(Edge-TTS, kokoro) 및 제로샷 음성 복제(E2 & F5-TTS, CosyVoice)를 지원하며, Whisper 오디오 처리, YouTube 다운로드, Demucs 보컬 분리 및 다국어 번역 기능을 제공합니다.
★ 12,730+0최근 7일 스타 변화 - #17
PyTorch 기반 음성 툴킷
★ 11,802+0최근 7일 스타 변화 - #18
스트리밍 ASR, 화자 분리, 번역, OpenAI/Deepgram 호환 API를 지원하는 실시간 로컬 음성 인식(STT) 도구
★ 10,990+0최근 7일 스타 변화 - #19
고급 음성 활동 감지, 웨이크 워드 활성화 및 즉각적인 전사를 지원하는 견고하고 효율적인 저지연 음성 텍스트 변환(STT) 라이브러리.
★ 10,108+0최근 7일 스타 변화 - #20
중국어, 광동어, 영어, 일본어, 한국어 ASR, 언어 식별, 감정 인식 및 오디오 이벤트 감지를 위한 오픈 소스 SenseVoiceSmall 모델입니다.
★ 9,209+0최근 7일 스타 변화 - #21
온라인 및 오프라인에서 여러 엔진과 API를 지원하는 Python용 음성 인식 모듈
★ 8,987+0최근 7일 스타 변화 - #22
딥러닝 기반 중국어 음성 인식 시스템
★ 8,386+0최근 7일 스타 변화 - #23
Apple의 MLX 프레임워크를 기반으로 구축된 텍스트 음성 변환(TTS), 음성 텍스트 변환(STT) 및 음성 간 변환(STS) 라이브러리로, Apple Silicon에서 효율적인 음성 분석을 제공합니다.
★ 7,826+0최근 7일 스타 변화 - #24★ 6,815+0최근 7일 스타 변화
- #25
Apple Silicon을 위한 온디바이스 음성 AI
★ 6,353+0최근 7일 스타 변화 - #26★ 6,210+0최근 7일 스타 변화
- #27
로컬(Nvidia Parakeet/Whisper) 및 클라우드 모델(BYOK)을 지원하는 음성 텍스트 변환(받아쓰기) 앱. 개인정보 보호 우선 및 크로스플랫폼 지원.
★ 6,133+0최근 7일 스타 변화 - #28
Silero Models: 매우 간단하게 사용할 수 있는 사전 학습된 텍스트 음성 변환(TTS) 모델
★ 6,084+0최근 7일 스타 변화 - #29★ 5,931+0최근 7일 스타 변화
- #30
OpenAI Whisper 기반 화자 분리(Speaker Diarization)를 지원하는 자동 음성 인식(ASR)
★ 5,634+0최근 7일 스타 변화