跳到主要內容
buildradar
Sign in
主題 · tokenizer

tokenizer

標記 tokenizer 主題、收錄中的開源專案,依星數排序。

專案數
27
總星數
138,565
平均星數
5,132
佔比
0.01%

常跟 tokenizer 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 tokenizer 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • LLMs-from-scratch@rasbt

    從頭開始、一步步在 PyTorch 中實作類似 ChatGPT 的大型語言模型

    104,229+219近 7 天星數變化
  • tokenizer@theseer

    一个小型库,用于将已标记的 PHP 源代码转换为 XML(以及可能的其他格式)

    5,193-2近 7 天星數變化
  • gigatoken@marcelroed

    語言模型分詞速度達 GB/s

    4,075+8近 7 天星數變化
  • sqlparse@andialbrecht

    A non-validating SQL parser module for Python

    4,016+1近 7 天星數變化
  • chevrotain@Chevrotain

    用於 JavaScript 的解析器建構工具包。

    2,797+0近 7 天星數變化
  • tiktokenizer@dqbd

    OpenAPI tokenizers 的線上遊樂場

    1,681+4近 7 天星數變化
  • hazm@roshan-research

    波斯語自然語言處理(NLP)工具包

    1,421+1近 7 天星數變化
  • natasha@natasha

    解決基本的俄語 NLP 任務,提供底層 Natasha 專案的 API

    1,348+1近 7 天星數變化
  • stream-json@uhop

    一個具有極低記憶體佔用的串流元件微型函式庫,用於建構自訂的 JSON 與 JSONC 處理管線 — 在 Node.js 或 Web Streams 上,透過受 SAX 啟發的 Token API 來解析、過濾和轉換遠大於可用記憶體的 JSON。

    1,196+0近 7 天星數變化
  • soynlp@lovit

    用於韓語自然語言處理的 Python 函式庫。提供詞彙擷取、斷詞器、詞性標註與前處理功能。

    992+2近 7 天星數變化
  • kagome@ikawaha

    使用純 Go 編寫的獨立日文形態學分析器

    981+1近 7 天星數變化
  • moo@no-context

    最佳化的 tokenizer/lexer 產生器!🐄 使用 /y 來提升效能。哞。

    883+0近 7 天星數變化
  • simple@wangfenjin

    支援中文和拼音的 SQLite fts5 全文搜尋擴充功能 | A SQLite3 fts5 tokenizer which supports Chinese and PinYin

    863+3近 7 天星數變化
  • gpt-tokenizer@niieani

    適用於 OpenAI GPT 模型(gpt-5、gpt-o*、gpt-4o 等)的最快 JavaScript BPE Tokenizer 編碼解碼器。移植自 OpenAI 的 tiktoken 並附加額外功能。

    841+2近 7 天星數變化
  • Wordless@BLKSerene

    一個支援多語言的整合語料庫工具,用於語言、文學與翻譯研究

    759+0近 7 天星數變化
  • Data-Labeling@risesoft-y9

    資料標註是一款專門對文字資料進行處理和標註的工具,透過簡化快捷的文字標註流程和動態演算法反饋,支援使用者快速標註關鍵字,並能透過演算法持續減少人工標註的成本和時間。資料標註的過程先由人工標註構建基礎,再由自動標註反哺人工標註,最後由人工標註進行糾偏,從而大幅提高標註的精準度和高效性。資料標註需要依賴開源的數字底座進行人員崗位管控。

    700+0近 7 天星數變化
  • ekphrasis@cbaziotis

    Ekphrasis 是一個文字處理工具,專為來自 Twitter 或 Facebook 等社群網路的文字而設計。Ekphrasis 使用來自兩個大型語料庫(英文維基百科、Twitter - 3.3億條英文推文)的單字統計數據,執行標記化、單字正規化、單字分割(用於分割 hashtag)和拼字校正。

    673+0近 7 天星數變化
  • open-korean-text@open-korean-text

    開源韓文文字處理器 - 一個開源的韓文文字處理器

    669+0近 7 天星數變化
  • lindera@lindera

    多語言形態學分析庫。

    667+2近 7 天星數變化
  • jflex@jflex-de

    具備完整 Unicode 支援的 Java™ 快速掃描器產生器

    634+1近 7 天星數變化
  • Deepdive-llama3-from-scratch@therealoliver

    逐步實現 llama3 推論、掌握核心概念、掌握過程推導、實作程式碼。

    630+0近 7 天星數變化
  • tokenmonster@alasdairforsythe

    適用於 Python、Go、C++ 與 Javascript 的非貪婪子詞分詞器與詞表訓練器

    627+0近 7 天星數變化
  • php-parser@glayzzle

    NodeJS PHP Parser - 提取 AST 或 Token

    565+0近 7 天星數變化
  • js-tokens@lydell

    輕量級 JavaScript 標記解析器。

    556+0近 7 天星數變化
  • fugashi@polm

    一個 Cython MeCab 封裝,用於快速且符合 Python 風格的日文斷詞與形態分析。

    536-1近 7 天星數變化
  • UniTok@FoundationVision

    [NeurIPS 2025 Spotlight] 用於視覺生成與理解的統一 Tokenizer

    529+0近 7 天星數變化
  • vscode-blockman@leodevbro

    用於高亮顯示巢狀程式碼區塊的 VSCode 擴充功能。

    512+0近 7 天星數變化
← 返回主題列表