speech-to-text
speech-to-text 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #31
오픈소스 음성 AI 플랫폼. Vapi 및 Retell의 셀프 호스팅 대안. 온프레미스, 음성 간(Speech to Speech) 또는 LLM/STT/TTS 전반의 BYOK 지원, 시각적 워크플로우 빌더, MCP 네이티브 및 telephony 지원.
★ 5,568+0최근 7일 스타 변화 - #32
오픈 소스 AI 비디오 로컬라이제이션 도구: YouTube/Bilibili 비디오 다운로드, 자막 인식 및 번역, 음성 복제 더빙, 오디오 트랙 믹싱 및 자막 삽입을 자동으로 수행합니다.
★ 5,404+0최근 7일 스타 변화 - #33★ 4,780+0최근 7일 스타 변화
- #34
TPU에서 최대 70배 속도 향상을 제공하는 OpenAI Whisper 모델의 JAX 구현
★ 4,679+0최근 7일 스타 변화 - #35★ 4,624+0최근 7일 스타 변화
- #36★ 4,122+0최근 7일 스타 변화
- #37
Windows LiveCaptions 기반의 가볍고 강력한 실시간 오디오/음성 번역 도구
★ 3,637+0최근 7일 스타 변화 - #38★ 3,403+0최근 7일 스타 변화
- #39
OpenAI Whisper ASR 웹서비스 API
★ 3,328+0최근 7일 스타 변화 - #40
Python을 다루기 귀찮은 분들을 위한 Whisper 및 Faster-Whisper 독립형 실행 파일.
★ 3,171+0최근 7일 스타 변화 - #41
LLaMA-Omni는 Llama-3.1-8B-Instruct 기반의 저지연 고품질 엔드투엔드 음성 상호작용 모델로, GPT-4o 수준의 음성 기능 구현을 목표로 합니다.
★ 3,147+0최근 7일 스타 변화 - #42★ 3,101+0최근 7일 스타 변화
- #43★ 3,068+0최근 7일 스타 변화
- #44★ 2,864+0최근 7일 스타 변화
- #45
단어 수준 타임스탬프와 신뢰도를 제공하는 다국어 자동 음성 인식
★ 2,842+0최근 7일 스타 변화 - #46
Google Meet, Microsoft Teams 및 Zoom을 위한 오픈소스 미팅 전사 API. 자동 참가 봇, 실시간 WebSocket 전사, AI 에이전트를 위한 MCP 서버. 셀프 호스팅 또는 SaaS 이용 가능.
★ 2,741+0최근 7일 스타 변화 - #47
앱에서 사용하는 프론티어 CoreML 오디오 모델 — 텍스트 음성 변환, 음성 텍스트 변환, 음성 활동 감지 및 화자 분리. Swift 기반, SOTA 오픈소스 구동.
★ 2,723+0최근 7일 스타 변화 - #48
Cluely의 오픈 소스 대안 - 회의, 면접, 대화 중 상대방 모르게 원활하게 작동하는 초고속, 프라이버시 우선 AI 어시스턴트. Tauri로 빌드되어 네이티브 성능을 제공하며 용량은 불과 10MB입니다. 화상 통화, 화면 공유, 녹화 시 전혀 감지되지 않습니다.
★ 2,619+0최근 7일 스타 변화 - #49★ 2,606+0최근 7일 스타 변화
- #50★ 2,537+0최근 7일 스타 변화
- #51
🔊 OpenAI가 개발한 오픈소스 AI 기반 음성 인식 시스템인 Whisper를 위한 멋진 목록
★ 2,375+0최근 7일 스타 변화 - #52
화면을 녹화하고 데모를 공유하세요. 무료 오픈소스, GPU 가속, 워터마크 없음, 구독 없음. Windows, macOS, Linux 지원. 활발히 유지보수 중.
★ 2,287+0최근 7일 스타 변화 - #53★ 2,278+0최근 7일 스타 변화
- #54
ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.
★ 2,214+0최근 7일 스타 변화 - #55
ASR/STT 자막 생성기. Qwen3-ASR, 로컬 LLM, Whisper, TEN-VAD 사용. JAV에 대한 노이즈 저항성 제공
★ 2,196+0최근 7일 스타 변화 - #56
tensorflow 딥러닝 프레임워크와 시퀀스 대 시퀀스 신경망을 사용한 음성 인식
★ 2,173+0최근 7일 스타 변화 - #57★ 2,170+0최근 7일 스타 변화
- #58★ 2,046+0최근 7일 스타 변화
- #59★ 1,892+0최근 7일 스타 변화
- #60
16개 이상의 모델 계열을 지원하는 ggml 음성 인식 추론
★ 1,872+0최근 7일 스타 변화