transcription
transcription टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर transcription के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और transcription टैग वाली रिपॉजिटरी।
- #1
Claude (या किसी भी LLM) को वास्तव में वीडियो देखने दें — सीन-अवेयर, डिडुप्लीकेटेड फ़्रेम + ट्रांसक्रिप्ट, URL या स्थानीय फ़ाइल से। स्थानीय रूप से चलता है, MIT।
★ 2,109 - #2★ 866
- #3
Open-source, agent-driven editing pipeline: create subtitles, motion graphics, slides, edit and render videos.
★ 563
- #1
गोपनीयता-प्रथम, AI मीटिंग सहायक जिसमें 4x तेज़ Parakeet/Whisper लाइव ट्रांसक्रिप्शन, स्पीकर डायरियाज़ेशन, और Rust पर निर्मित Ollama सारांश शामिल है। 100% स्थानीय प्रोसेसिंग, किसी क्लाउड की आवश्यकता नहीं। Meetily (Meetly Ai - https://meetily.ai) macOS और Windows के लिए #1 सेल्फ-होस्टेड, ओपन-सोर्स AI मीटिंग नोट टेकर है। समझें कि मीटिंग के मिनट्स कैसे लिखें
★ 30,252+195पिछले 7 दिनों में स्टार का बदलाव - #2
ट्रेनिंग, इन्फरेंस, स्ट्रीमिंग ASR, VAD, पंक्चुएशन, स्पीकर डायराइजेशन पाइपलाइन्स और OpenAI-संगत/MCP सर्विंग के लिए ओपन-सोर्स स्पीच रिकग्निशन टूलकिट।
★ 20,136+64पिछले 7 दिनों में स्टार का बदलाव - #3
VoiceStudio एक ओपन-सोर्स, पूरी तरह से लोकल ElevenLabs विकल्प है - जो 646 भाषाओं में वॉयस क्लोनिंग, वॉयस डिज़ाइन, वीडियो डबिंग, डिक्टेशन, ट्रांसक्रिप्शन और ऑडियोबुक निर्माण की सुविधा देता है।
★ 14,835+2,880पिछले 7 दिनों में स्टार का बदलाव - #4
AI जो आपकी स्क्रीन देखता है, आपकी बातचीत सुनता है और आपको बताता है कि क्या करना है
★ 13,377+46पिछले 7 दिनों में स्टार का बदलाव - #5
क्रिएटर्स और डेवलपर्स के लिए Gradio WebUI, जिसमें प्रमुख TTS (Edge-TTS, kokoro) और ज़ीरो-शॉट Voice Cloning (E2 & F5-TTS, CosyVoice) शामिल हैं, साथ ही Whisper ऑडियो प्रोसेसिंग, YouTube डाउनलोड, Demucs वोकल आइसोलेशन और बहुभाषी अनुवाद शामिल हैं।
★ 12,730+54पिछले 7 दिनों में स्टार का बदलाव - #6
मंदारिन, कैंटोनीज़, अंग्रेजी, जापानी और कोरियाई ASR, भाषा पहचान, भावना पहचान और ऑडियो इवेंट डिटेक्शन के लिए ओपन-सोर्स SenseVoiceSmall मॉडल।
★ 9,209+37पिछले 7 दिनों में स्टार का बदलाव - #7
लोकल Gradio UI के साथ FunASR-संचालित वीडियो ट्रांसक्रिप्शन, सबटाइटल जनरेशन, और LLM-सहायता प्राप्त क्लिपिंग टूल।
★ 6,210+13पिछले 7 दिनों में स्टार का बदलाव - #8
पिच बेंड डिटेक्शन के साथ एक हल्का लेकिन शक्तिशाली ऑडियो-टू-MIDI कन्वर्टर।
★ 5,522+21पिछले 7 दिनों में स्टार का बदलाव - #9
ऑन-डिवाइस उपशीर्षक निर्माण जो सीधे DaVinci Resolve, Premiere और After Effects से जुड़ता है।
★ 4,122+20पिछले 7 दिनों में स्टार का बदलाव - #10★ 3,638+8पिछले 7 दिनों में स्टार का बदलाव
- #11
वेब UI के साथ किसी भी ऑडियो को टेक्स्ट में ट्रांसक्राइब करें, उपशीर्षक (subtitles) का अनुवाद और संपादन 100% स्थानीय रूप से करें। Whisper मॉडल द्वारा संचालित!
★ 3,068+2पिछले 7 दिनों में स्टार का बदलाव - #12★ 3,016+14पिछले 7 दिनों में स्टार का बदलाव
- #13★ 2,893+2पिछले 7 दिनों में स्टार का बदलाव
- #14
Google Meet, Microsoft Teams और Zoom के लिए ओपन-सोर्स मीटिंग ट्रांसक्रिप्शन API। ऑटो-जॉइन बॉट्स, रियल-टाइम WebSocket ट्रांसक्रिप्ट, AI एजेंटों के लिए MCP सर्वर। सेल्फ-होस्ट करें या होस्टेड SaaS का उपयोग करें।
★ 2,741+15पिछले 7 दिनों में स्टार का बदलाव - #15
🔊 Whisper के लिए शानदार सूची — OpenAI द्वारा विकसित एक ओपन-सोर्स AI-संचालित वाक् पहचान प्रणाली
★ 2,375+1पिछले 7 दिनों में स्टार का बदलाव - #16★ 2,226+3पिछले 7 दिनों में स्टार का बदलाव
- #17
स्वचालित ऑडियो ट्रांसक्रिप्शन के लिए अत्याधुनिक AI तकनीक। OpenAI के Whisper और pyannote (स्पीकर पहचान) के लिए एक अच्छा GUI।
★ 2,145+8पिछले 7 दिनों में स्टार का बदलाव - #18
Claude (या किसी भी LLM) को वास्तव में वीडियो देखने दें — सीन-अवेयर, डिडुप्लीकेटेड फ़्रेम + ट्रांसक्रिप्ट, URL या स्थानीय फ़ाइल से। स्थानीय रूप से चलता है, MIT।
★ 2,109+20पिछले 7 दिनों में स्टार का बदलाव - #19★ 2,024+1पिछले 7 दिनों में स्टार का बदलाव
- #20★ 1,892+2पिछले 7 दिनों में स्टार का बदलाव
- #21
macOS के लिए स्थानीय स्पीच-टू-текст ऑन-डिवाइस AI, पूरी तरह से निजी, वैकल्पिक क्लाउड
★ 1,759+12पिछले 7 दिनों में स्टार का बदलाव - #22
AI का उपयोग करके स्थानीय भाषण पहचान और कैप्शनिंग के लिए OBS प्लगइन
★ 1,597+8पिछले 7 दिनों में स्टार का बदलाव - #23
🎙️ AI डिक्टेशन ऐप - ओपन सोर्स और लोकल-फर्स्ट ⚡ 3x तेजी से टाइप करें, कीबोर्ड की आवश्यकता नहीं। 🆓 ओपन सोर्स मॉडल द्वारा संचालित, ऑफ़लाइन काम करता है, तेज़ और सटीक।
★ 1,520+8पिछले 7 दिनों में स्टार का बदलाव - #24
पीडल के साथ ByteDance के पियानो ट्रांसक्रिप्शन के लिए सरल GUI।
★ 1,514+3पिछले 7 दिनों में स्टार का बदलाव - #25
चीनी, बोलियों, लहजों और बहुभाषी भाषण के लिए ओपन-सोर्स LLM-आधारित ASR मॉडल परिवार, FunASR, vLLM, स्ट्रीमिंग और llama.cpp रनटाइम के साथ।
★ 1,512+10पिछले 7 दिनों में स्टार का बदलाव - #26
हर मीटिंग, हर विचार, हर वॉयस नोट, आपकी AI द्वारा खोजने योग्य। ओपन-सोर्स, गोपनीयता-प्रथम वार्तालाप मेमोरी लेयर।
★ 1,462+6पिछले 7 दिनों में स्टार का बदलाव - #27
मल्टी-बैकएंड whisper ऐप। अत्यंत तेज़। Mac-arm अनुकूलित। स्थापित करने में आसान। एक स्थानीय फ़ाइल या URL इनपुट करें और यह सेवा Whisper AI का उपयोग करके इसे ट्रांसक्रिप्ट करेगी। पूरी तरह से निजी और निःशुल्क 🤯🤯🤯
★ 1,394+0पिछले 7 दिनों में स्टार का बदलाव - #28
नियंत्रित ट्रांसक्रिप्शन। शब्द-स्तर के टाइमस्टैम्प के साथ सटीक (प्रत्येक फिलर, विराम, हकलाना, स्वर ध्वनि) या इच्छित (वक्ता क्या कहना चाहता था, पठनीयता के लिए अनुकूलित)।
★ 1,371+13पिछले 7 दिनों में स्टार का बदलाव - #29
हार्डवेयर हैकर्स - दो महीने में $12,000 ARR की व्यावहारिक यात्रा। यह पुस्तक Podwise उत्पाद की यात्रा का एक ईमानदार रिकॉर्ड है, जिसमें प्रेरणा, निर्माण, लॉन्च, विकास और समीक्षा के पांच अध्याय शामिल हैं। यदि आप विशेषज्ञों के साथ चर्चा करना चाहते हैं, तो आधिकारिक 'हार्डवेयर हैकर्स' नॉलेज प्लैनेट में शामिल हों। Podwise की कहानी अभी शुरू हुई है, और हम अपनी सीख साझा करना जारी रखेंगे। सफलता को दोहराया नहीं जा सकता, लेकिन विफलता से सीखा जा सकता है। शामिल होने के लिए नीचे दिए गए लिंक पर क्लिक करें।
★ 1,370+0पिछले 7 दिनों में स्टार का बदलाव - #30
वीडियो और ऑडियो से सबटाइटल जनरेशन, srt फ़ाइल जनरेशन। किसी तीसरे पक्ष के API की आवश्यकता नहीं, स्थानीय रूप से ऑडियो-टू-टेक्स्ट रूपांतरण। Transformer-आधारित वीडियो सबटाइटल जनरेशन फ्रेमवर्क। वीडियो से सबटाइटल जेनरेट करने और srt फ़ाइलें बनाने के लिए एक GUI टूल।
★ 1,179+3पिछले 7 दिनों में स्टार का बदलाव