跳到主要内容
buildradar
Sign in
主题 · tokenizer

tokenizer

标记 tokenizer 主题、收录中的开源项目,按星标数排序。

项目数
27
总星标数
138,565
平均星标数
5,132
占比
0.01%

常跟 tokenizer 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 tokenizer 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • LLMs-from-scratch@rasbt

    从头开始、一步步在 PyTorch 中实现类似 ChatGPT 的大型语言模型

    104,229+219近 7 天星标变化
  • tokenizer@theseer

    一个小型库,用于将已标记的 PHP 源代码转换为 XML(以及可能的其他格式)

    5,193-2近 7 天星标变化
  • gigatoken@marcelroed

    语言模型分词速度达 GB/s

    4,075+8近 7 天星标变化
  • sqlparse@andialbrecht

    A non-validating SQL parser module for Python

    4,016+1近 7 天星标变化
  • chevrotain@Chevrotain

    用于 JavaScript 的解析器构建工具包。

    2,797+0近 7 天星标变化
  • tiktokenizer@dqbd

    OpenAPI tokenizers 的在线游乐场

    1,681+4近 7 天星标变化
  • hazm@roshan-research

    波斯语自然语言处理(NLP)工具包

    1,421+1近 7 天星标变化
  • natasha@natasha

    解决基本的俄语 NLP 任务,提供底层 Natasha 项目的 API

    1,348+1近 7 天星标变化
  • stream-json@uhop

    一个具有极低内存占用的流组件微型库,用于构建自定义的 JSON 与 JSONC 处理管道 — 在 Node.js 或 Web Streams 上,通过受 SAX 启发的 Token API 来解析、过滤和转换远大于可用内存的 JSON。

    1,196+0近 7 天星标变化
  • soynlp@lovit

    用于韩语自然语言处理的 Python 库。提供词汇提取、分词器、词性标注与预处理功能。

    992+2近 7 天星标变化
  • kagome@ikawaha

    使用纯 Go 编写的独立日文形态学分析器

    981+1近 7 天星标变化
  • moo@no-context

    优化的 tokenizer/lexer 生成器!🐄 使用 /y 来提升性能。哞。

    883+0近 7 天星标变化
  • simple@wangfenjin

    支持中文和拼音的 SQLite fts5 全文搜索扩展 | A SQLite3 fts5 tokenizer which supports Chinese and PinYin

    863+3近 7 天星标变化
  • gpt-tokenizer@niieani

    适用于 OpenAI GPT 模型(gpt-5、gpt-o*、gpt-4o 等)的最快 JavaScript BPE Tokenizer 编码解码器。移植自 OpenAI 的 tiktoken 并附加额外功能。

    841+2近 7 天星标变化
  • Wordless@BLKSerene

    一个支持多语言的集成语料库工具,用于语言、文学与翻译研究

    759+0近 7 天星标变化
  • Data-Labeling@risesoft-y9

    数据标注是一款专门对文本数据进行处理和标注的工具,通过简化快捷的文本标注流程和动态算法反馈,支持用户快速标注关键词,并能通过算法持续减少人工标注的成本和时间。数据标注的过程先由人工标注构建基础,再由自动标注反哺人工标注,最后由人工标注进行纠偏,从而大幅提高标注的精准度和高效性。数据标注需要依赖开源的数字底座进行人员岗位管控。

    700+0近 7 天星标变化
  • ekphrasis@cbaziotis

    Ekphrasis 是一个文本处理工具,专为来自 Twitter 或 Facebook 等社交网络的文本而设计。Ekphrasis 使用来自两个大型语料库(英文维基百科、Twitter - 3.3亿条英文推文)的单词统计数据,执行标记化、单词规范化、单词分割(用于分割 hashtag)和拼写校正。

    673+0近 7 天星标变化
  • open-korean-text@open-korean-text

    开源韩文文本处理器 - 一个开源的韩文文本处理器

    669+0近 7 天星标变化
  • lindera@lindera

    多语言形态学分析库。

    667+2近 7 天星标变化
  • jflex@jflex-de

    具备完整 Unicode 支持的 Java™ 快速扫描器生成器

    634+1近 7 天星标变化
  • Deepdive-llama3-from-scratch@therealoliver

    逐步实现 llama3 推理、掌握核心概念、掌握过程推导、实现代码。

    630+0近 7 天星标变化
  • tokenmonster@alasdairforsythe

    适用于 Python、Go、C++ 与 Javascript 的非贪婪子词分词器与词表训练器

    627+0近 7 天星标变化
  • php-parser@glayzzle

    NodeJS PHP Parser - 提取 AST 或 Token

    565+0近 7 天星标变化
  • js-tokens@lydell

    轻量级 JavaScript 标记解析器。

    556+0近 7 天星标变化
  • fugashi@polm

    一个 Cython MeCab 封装,用于快速且符合 Python 风格的日文分词与形态分析。

    536-1近 7 天星标变化
  • UniTok@FoundationVision

    [NeurIPS 2025 Spotlight] 用于视觉生成与理解的统一 Tokenizer

    529+0近 7 天星标变化
  • vscode-blockman@leodevbro

    用于高亮显示嵌套代码块的 VSCode 扩展功能。

    512+0近 7 天星标变化
← 返回主题列表