asr
asr 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #31
인터넷 연결 없이 ncnn을 사용하는 차세대 Kaldi 기반 실시간 음성 인식 및 음성 활동 감지(VAD). iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A 등 지원
★ 1,777-1최근 7일 스타 변화 - #32
백령(Bailing)은 ASR+LLM+TTS를 통해 구현된 GPT-4o 유사 음성 대화 봇으로, DeepSeek R1 등 우수한 대형 모델을 통합하고 openClaw를 연동한 진정한 개인용 음성 비서입니다. 지연 시간이 800ms에 불과하며 Mac 등 저사양 환경에서도 실행 가능하고 인터럽트를 지원합니다.
★ 1,759+2최근 7일 스타 변화 - #33★ 1,622+8최근 7일 스타 변화
- #34
LLM, 컴퓨터 비전 및 자동 음성 인식을 사용하여 비디오를 분석합니다.
★ 1,570+8최근 7일 스타 변화 - #35
🎙️ AI 받아쓰기 앱 - 오픈소스 및 로컬 퍼스트 ⚡ 키보드 없이 3배 더 빠르게 타이핑하세요. 🆓 오픈소스 모델 기반, 오프라인 작동, 빠르고 정확합니다.
★ 1,520+8최근 7일 스타 변화 - #36
FunASR, vLLM, 스트리밍, llama.cpp 런타임을 지원하는 중국어, 방언, 사투리 및 다국어 음성을 위한 오픈소스 LLM 기반 ASR 모델 패밀리
★ 1,512+10최근 7일 스타 변화 - #37
🍦 Speech-AI-Forge는 TTS 생성 모델을 중심으로 개발된 프로젝트로, API 서버 및 Gradio 기반 WebUI를 구현합니다.
★ 1,418+0최근 7일 스타 변화 - #38
비디오 동기화 번역. 비디오 더빙
★ 1,413+2최근 7일 스타 변화 - #39
제어 가능한 전사(Transcription) 기능. 단어 수준의 타임스탬프와 함께 축어적(모든 단어, 추임새, 일시 정지, 말더듬, 음성 소리) 또는 의도적(화자가 말하고자 한 내용, 가독성 최적화) 방식으로 제공.
★ 1,371+13최근 7일 스타 변화 - #40★ 1,347+6최근 7일 스타 변화
- #41★ 1,303-1최근 7일 스타 변화
- #42
StreamSpeech는 오프라인 및 동시 음성 인식, 음성 번역, 음성 합성을 위한 "All in One" 심리스 모델입니다.
★ 1,288+0최근 7일 스타 변화 - #43
Vosk 및 Kaldi 라이브러리 기반의 WebSocket, gRPC, WebRTC 음성 인식 서버
★ 1,262+1최근 7일 스타 변화 - #44
타임스탬프 데이터 없는 학습, 타임스탬프 데이터가 있는 학습, 음성 데이터 없는 학습을 지원하도록 Whisper 음성 인식 모델을 파인튜닝합니다. 추론을 가속화하고 Web 배포, Windows 데스크톱 배포 및 Android 배포를 지원합니다.
★ 1,222-1최근 7일 스타 변화 - #45
Apple Silicon용 AI 음성 toolkit — MLX 및 CoreML 기반 ASR, TTS, 음성 대 음성, VAD 및 화자 분할
★ 1,161+4최근 7일 스타 변화 - #46
실환경을 위해 구축된 최초의 파운데이션 ASR - 7가지 원자적 음향 조건, 54가지 복합 시나리오, 260만 개의 샘플을 포함하며, 기존 모델이 실패하는 환경에서 SOTA 대비 최대 30% 성능 향상
★ 1,136+3최근 7일 스타 변화 - #47
"Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020) 논문의 비공식 PyTorch 구현체
★ 1,132+1최근 7일 스타 변화 - #48
SGLang-Omni는 TTS, ASR, 음성 및 옴니 모델을 위한 고성능 서빙을 지원합니다.
★ 1,118+143최근 7일 스타 변화 - #49★ 1,057+8최근 7일 스타 변화
- #50
Vosk 라이브러리를 사용한 Android용 오프라인 음성 인식
★ 1,056+0최근 7일 스타 변화 - #51★ 1,053+15최근 7일 스타 변화
- #52★ 1,040+1최근 7일 스타 변화
- #53★ 984+4최근 7일 스타 변화
- #54★ 939+0최근 7일 스타 변화
- #55
로컬 기기에서 실행되는 프라이버시 중심의 안전한 음성 입력 도구 VocoType. 단축키로 음성을 실시간 텍스트로 변환하여 현재 애플리케이션에 자동으로 입력합니다. 음성-텍스트 MCP, AI 텍스트 최적화, 사용자 정의 대체 사전, 녹음/비디오-텍스트 변환 등의 기능을 지원하여 음성 입력을 더욱 효율적이고 안전하게 만듭니다.
★ 928+9최근 7일 스타 변화 - #56
이 프로젝트는 미세조정 및 처리된 Whisper ASR 모델을 사용하여 음성을 텍스트로 변환하는 사용자 수준 액세스 지원 API를 제공합니다.
★ 914+0최근 7일 스타 변화 - #57
🔥🔥🔥 자바 무료 오프라인 AI 알고리즘 툴박스. 얼굴 인식, 라이브니스 감지, 표정 인식, 객체 검출, 인스턴스 분할, 보행자 검출, OCR 문자 인식, 번호판 인식, 표 인식, ASR+TTS, 기계 번역 등 기능 지원, Maven 의존성 추가로 사용 가능. PyTorch, Tensorflow 지원, Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5), Whisper 등 주류 모델 통합 완료
★ 908+3최근 7일 스타 변화 - #58
음성 인식, 전사, 변환 등을 위한 사용자 친화적인 툴킷 | 간편하게 사용할 수 있는 음성 도구 상자
★ 873+0최근 7일 스타 변화 - #59
PaddlePaddle 기반의 엔드투엔드 중국어 음성 인식 구현. 입문부터 실전까지, 초보자를 위한 간단한 사례와 실용적인 기업 프로젝트 포함. DeepSpeech2, Conformer, Squeezeformer 모델 지원
★ 870-1최근 7일 스타 변화 - #60★ 854+3최근 7일 스타 변화