asr
asr 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 asr 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 asr 태그가 달린 리포지토리예요.
- #1
ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.
★ 2,214 - #2
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501 - #3
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 327
- #1★ 23,864+61최근 7일 스타 변화
- #2★ 20,136+64최근 7일 스타 변화
- #3★ 18,379+21최근 7일 스타 변화
- #4★ 15,101+17최근 7일 스타 변화
- #5
인터넷 연결 없이 onnxruntime과 차세대 Kaldi를 사용하는 음성 인식, 음성 합성, 화자 분할, 음성 강화, 소스 분리 및 VAD. 임베디드 시스템, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 서버, websocket 서버/클라이언트 지원 및 12개 프로그래밍 언어 지원
★ 14,575+95최근 7일 스타 변화 - #6
자기 지도 학습 모델, 구두점이 포함된 SOTA/스트리밍 ASR, 텍스트 프론트엔드가 포함된 스트리밍 TTS, 화자 인증 시스템, 엔드투엔드 음성 번역 및 키워드 스포팅을 포함하는 사용하기 쉬운 음성 툴킷. NAACL2022 최우수 시연상(Best Demo Award) 수상
★ 12,676+5최근 7일 스타 변화 - #7
PyTorch 기반 음성 툴킷
★ 11,802+10최근 7일 스타 변화 - #8
중국어, 광동어, 영어, 일본어, 한국어 ASR, 언어 식별, 감정 인식 및 오디오 이벤트 감지를 위한 오픈 소스 SenseVoiceSmall 모델입니다.
★ 9,209+37최근 7일 스타 변화 - #9
주어진 YouTube 동영상의 자막을 가져올 수 있는 Python API입니다. 자동 생성된 자막도 지원하며, 다른 Selenium 기반 솔루션과 달리 API 키나 헤드리스 브라우저가 필요하지 않습니다!
★ 8,143+14최근 7일 스타 변화 - #10
🤖 wukong-robot은 간단하고 유연하며 우수한 중국어 음성 대화 로봇/스마트 스피커 프로젝트로, ChatGPT 멀티턴 대화 기능을 지원하며 뇌-컴퓨터 상호작용을 지원하는 최초의 오픈 소스 스마트 스피커 프로젝트일 수도 있습니다.
★ 7,126+2최근 7일 스타 변화 - #11★ 6,210+13최근 7일 스타 변화
- #12
OpenAI Whisper 기반 화자 분리(Speaker Diarization)를 지원하는 자동 음성 인식(ASR)
★ 5,634+1최근 7일 스타 변화 - #13
HTML5 JS 녹음(mp3, wav, ogg, webm, amr, g711a, g711u 포맷). PC, Android, 일부 iOS 웹 브라우저, 하이브리드 앱(Android/iOS 소스 제공), 위챗 지원. ASR 음성 인식 텍스트 변환, H5 음성 통화 채팅 예제, DTMF 인코딩/디코딩 제공
★ 5,631+3최근 7일 스타 변화 - #14★ 5,229+1최근 7일 스타 변화
- #15★ 4,070+12최근 7일 스타 변화
- #16
Streamer-Sales 쌰오관 — 쇼호스트 LLM 대형 모델🛒🎁, 주어진 상품의 특징에 따라 사용자의 구매 의욕을 자극하는 각도로 상품을 설명할 수 있는 쇼호스트 LLM 대형 모델입니다.🚀⭐ 상세한 데이터 생성 프로세스 포함❗ 📦 또한 LMDeploy 가속 추론🚀, RAG 검색 augmentation 생성 📚, TTS 텍스트 음성 변환🔊, 디지털 휴먼 생성 🦸, Agent를 이용한 실시간 정보 웹 검색🌐, ASR 음성 텍스트 변환🎙️, Vue 생태계 기반 프론트엔드🍍, FastAPI 기반 백엔드🗝️, Docker-compose 패키지 배포🐋 통합
★ 3,764+1최근 7일 스타 변화 - #17★ 3,403+44최근 7일 스타 변화
- #18
OpenAI Whisper ASR 웹서비스 API
★ 3,328+2최근 7일 스타 변화 - #19
Python을 다루기 귀찮은 분들을 위한 Whisper 및 Faster-Whisper 독립형 실행 파일.
★ 3,171+2최근 7일 스타 변화 - #20★ 3,061+164최근 7일 스타 변화
- #21
PySide6를 사용한 faster_whisper GUI
★ 2,995+4최근 7일 스타 변화 - #22★ 2,864+0최근 7일 스타 변화
- #23
단어 수준 타임스탬프와 신뢰도를 제공하는 다국어 자동 음성 인식
★ 2,842+1최근 7일 스타 변화 - #24
앱에서 사용하는 프론티어 CoreML 오디오 모델 — 텍스트 음성 변환, 음성 텍스트 변환, 음성 활동 감지 및 화자 분리. Swift 기반, SOTA 오픈소스 구동.
★ 2,723+13최근 7일 스타 변화 - #25★ 2,606+1최근 7일 스타 변화
- #26
오디오 및 비디오 콘텐츠를 빠르게 추출하여 구조화된 markdown 노트로 정리
★ 2,483+7최근 7일 스타 변화 - #27
ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.
★ 2,214+115최근 7일 스타 변화 - #28
만다린, 중국 방언 및 영어를 지원하는 오픈 소스 산업용 ASR 모델로, 공인된 만다린 ASR 벤치마크에서 새로운 SOTA를 달성하는 동시에 뛰어난 가사 인식 기능도 제공합니다.
★ 1,975+2최근 7일 스타 변화 - #29
16개 이상의 모델 계열을 지원하는 ggml 음성 인식 추론
★ 1,872+19최근 7일 스타 변화 - #30★ 1,816+5최근 7일 스타 변화