tokenizer
標記 tokenizer 主題、收錄中的開源專案,依星數排序。
相關主題
常跟 tokenizer 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 tokenizer 主題的專案。
近 90 天內還沒有新專案標記這個主題。
- #1
從頭開始、一步步在 PyTorch 中實作類似 ChatGPT 的大型語言模型
★ 104,229+219近 7 天星數變化 - #2★ 5,193-2近 7 天星數變化
- #3★ 4,075+8近 7 天星數變化
- #4★ 4,016+1近 7 天星數變化
- #5
用於 JavaScript 的解析器建構工具包。
★ 2,797+0近 7 天星數變化 - #6
OpenAPI tokenizers 的線上遊樂場
★ 1,681+4近 7 天星數變化 - #7★ 1,421+1近 7 天星數變化
- #8★ 1,348+1近 7 天星數變化
- #9
一個具有極低記憶體佔用的串流元件微型函式庫,用於建構自訂的 JSON 與 JSONC 處理管線 — 在 Node.js 或 Web Streams 上,透過受 SAX 啟發的 Token API 來解析、過濾和轉換遠大於可用記憶體的 JSON。
★ 1,196+0近 7 天星數變化 - #10★ 992+2近 7 天星數變化
- #11★ 981+1近 7 天星數變化
- #12★ 883+0近 7 天星數變化
- #13
支援中文和拼音的 SQLite fts5 全文搜尋擴充功能 | A SQLite3 fts5 tokenizer which supports Chinese and PinYin
★ 863+3近 7 天星數變化 - #14
適用於 OpenAI GPT 模型(gpt-5、gpt-o*、gpt-4o 等)的最快 JavaScript BPE Tokenizer 編碼解碼器。移植自 OpenAI 的 tiktoken 並附加額外功能。
★ 841+2近 7 天星數變化 - #15★ 759+0近 7 天星數變化
- #16
資料標註是一款專門對文字資料進行處理和標註的工具,透過簡化快捷的文字標註流程和動態演算法反饋,支援使用者快速標註關鍵字,並能透過演算法持續減少人工標註的成本和時間。資料標註的過程先由人工標註構建基礎,再由自動標註反哺人工標註,最後由人工標註進行糾偏,從而大幅提高標註的精準度和高效性。資料標註需要依賴開源的數字底座進行人員崗位管控。
★ 700+0近 7 天星數變化 - #17
Ekphrasis 是一個文字處理工具,專為來自 Twitter 或 Facebook 等社群網路的文字而設計。Ekphrasis 使用來自兩個大型語料庫(英文維基百科、Twitter - 3.3億條英文推文)的單字統計數據,執行標記化、單字正規化、單字分割(用於分割 hashtag)和拼字校正。
★ 673+0近 7 天星數變化 - #18
開源韓文文字處理器 - 一個開源的韓文文字處理器
★ 669+0近 7 天星數變化 - #19★ 667+2近 7 天星數變化
- #20★ 634+1近 7 天星數變化
- #21
逐步實現 llama3 推論、掌握核心概念、掌握過程推導、實作程式碼。
★ 630+0近 7 天星數變化 - #22
適用於 Python、Go、C++ 與 Javascript 的非貪婪子詞分詞器與詞表訓練器
★ 627+0近 7 天星數變化 - #23
NodeJS PHP Parser - 提取 AST 或 Token
★ 565+0近 7 天星數變化 - #24★ 556+0近 7 天星數變化
- #25★ 536-1近 7 天星數變化
- #26★ 529+0近 7 天星數變化
- #27
用於高亮顯示巢狀程式碼區塊的 VSCode 擴充功能。
★ 512+0近 7 天星數變化