speech-recognition
speech-recognition 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #61
💎 ASR, TTS 및 기타 음성 기술을 위한 접근 가능한 음성 말뭉치(speech corpora) 목록
★ 1,399+0최근 7일 스타 변화 - #62
Apple Silicon Mac에서 LLM 파인튜닝. MLX 네이티브 기반 SFT, DPO, GRPO, Vision, TTS, STT, Embedding, OCR 파인튜닝 지원. Unsloth 호환 API.
★ 1,398+8최근 7일 스타 변화 - #63
제어 가능한 전사(Transcription) 기능. 단어 수준의 타임스탬프와 함께 축어적(모든 단어, 추임새, 일시 정지, 말더듬, 음성 소리) 또는 의도적(화자가 말하고자 한 내용, 가독성 최적화) 방식으로 제공.
★ 1,371+13최근 7일 스타 변화 - #64
CTranslate2 기반의 원본 OpenAI 클라이언트와 호환되는 Whisper 명령 줄 클라이언트
★ 1,346+2최근 7일 스타 변화 - #65
Python 라이브러리로 구축된 개인 비서. 이메일 발송, 광학 문자 인식(OCR), API 연동을 통한 동적 뉴스 브리핑, 할 일 목록 생성, 음성 명령으로 웹사이트 열기, 음악 재생, 위키피디아 검색, 지능형 자동 맞춤법 검사 사전, 날씨 정보(기온, 풍속, 습도) 제공 등 거의 모든 기능을 수행합니다.
★ 1,341+5최근 7일 스타 변화 - #66★ 1,338+42최근 7일 스타 변화
- #67
StreamSpeech는 오프라인 및 동시 음성 인식, 음성 번역, 음성 합성을 위한 "All in One" 심리스 모델입니다.
★ 1,288+0최근 7일 스타 변화 - #68★ 1,274+1최근 7일 스타 변화
- #69
Vosk 및 Kaldi 라이브러리 기반의 WebSocket, gRPC, WebRTC 음성 인식 서버
★ 1,262+1최근 7일 스타 변화 - #70
타임스탬프 데이터 없는 학습, 타임스탬프 데이터가 있는 학습, 음성 데이터 없는 학습을 지원하도록 Whisper 음성 인식 모델을 파인튜닝합니다. 추론을 가속화하고 Web 배포, Windows 데스크톱 배포 및 Android 배포를 지원합니다.
★ 1,222-1최근 7일 스타 변화 - #71★ 1,212-1최근 7일 스타 변화
- #72
논문, 동영상, 블로그, 공식 저장소 및 Colab 노트북을 포함하는 자연어 처리용 Transformers 모델 모음
★ 1,179+0최근 7일 스타 변화 - #73
Apple의 Foundation Models 프레임워크를 사용하여 앱을 빌드, 테스트 및 평가하기 위한 실습 랩
★ 1,178+1최근 7일 스타 변화 - #74
개인 AI 어시스턴트가 포함된 비공개 로그북. 에이전트가 기록을 읽고 다음 작업을 제안하며 사용자가 변경 사항을 승인함. 기기 간 종단간 암호화 동기화를 지원하며 서버는 암호문만 확인 가능. 로컬 AI 사용 옵션 제공
★ 1,168+3최근 7일 스타 변화 - #75
Apple Silicon용 AI 음성 toolkit — MLX 및 CoreML 기반 ASR, TTS, 음성 대 음성, VAD 및 화자 분할
★ 1,161+4최근 7일 스타 변화 - #76
오프라인에서 작동하는 러시아어 음성 어시스턴트 Ирина. 플러그인을 통한 스킬을 지원합니다.
★ 1,153+0최근 7일 스타 변화 - #77★ 1,149-1최근 7일 스타 변화
- #78
앱을 위한 셀프 코딩 시스템 — Cordova용 Alan AI SDK
★ 1,132+0최근 7일 스타 변화 - #79
"Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020) 논문의 비공식 PyTorch 구현체
★ 1,132+1최근 7일 스타 변화 - #80
SGLang-Omni는 TTS, ASR, 음성 및 옴니 모델을 위한 고성능 서빙을 지원합니다.
★ 1,118+143최근 7일 스타 변화 - #81
Youtube 및 Twitch 스트리밍을 위한 AI Vtuber
★ 1,115+1최근 7일 스타 변화 - #82
모바일 기기에서 고품질 음성 전사를 더욱 쉽게 사용할 수 있도록 하는 오픈소스 iOS 앱
★ 1,102+8최근 7일 스타 변화 - #83
💬📝 OpenAI의 Whisper 음성 인식 모델을 사용하는 소형 구술 앱.
★ 1,100+2최근 7일 스타 변화 - #84
Kaldi 툴킷과 GStreamer 프레임워크를 기반으로 하는 실시간 전이중 음성 인식 서버
★ 1,094+1최근 7일 스타 변화 - #85
Vosk 라이브러리를 사용한 Android용 오프라인 음성 인식
★ 1,056+0최근 7일 스타 변화 - #86★ 1,040+1최근 7일 스타 변화
- #87
:zap: TensorFlowASR: Tensorflow 2 기반의 최신 수준에 준하는 자동 음성 인식(ASR) 구현. 문자 또는 서브워드를 사용할 수 있는 언어 지원
★ 1,010+0최근 7일 스타 변화 - #88
ChatGPT 및 기타 AI 모델과 통합되어 영상의 내용을 전사, 이해하고 검색할 수 있는 AI 기반 편집 도구
★ 1,009+2최근 7일 스타 변화 - #89★ 984+4최근 7일 스타 변화
- #90
Python/JS 환경에서 자체 호스팅 Whisper와 WebSocket을 사용한 실시간 오디오 전사
★ 960+1최근 7일 스타 변화