tokenizer
标记 tokenizer 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 tokenizer 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 tokenizer 主题的项目。
近 90 天内还没有新项目标记这个主题。
- #1
从头开始、一步步在 PyTorch 中实现类似 ChatGPT 的大型语言模型
★ 104,229+219近 7 天星标变化 - #2★ 5,193-2近 7 天星标变化
- #3★ 4,075+8近 7 天星标变化
- #4★ 4,016+1近 7 天星标变化
- #5
用于 JavaScript 的解析器构建工具包。
★ 2,797+0近 7 天星标变化 - #6
OpenAPI tokenizers 的在线游乐场
★ 1,681+4近 7 天星标变化 - #7★ 1,421+1近 7 天星标变化
- #8★ 1,348+1近 7 天星标变化
- #9
一个具有极低内存占用的流组件微型库,用于构建自定义的 JSON 与 JSONC 处理管道 — 在 Node.js 或 Web Streams 上,通过受 SAX 启发的 Token API 来解析、过滤和转换远大于可用内存的 JSON。
★ 1,196+0近 7 天星标变化 - #10★ 992+2近 7 天星标变化
- #11★ 981+1近 7 天星标变化
- #12★ 883+0近 7 天星标变化
- #13
支持中文和拼音的 SQLite fts5 全文搜索扩展 | A SQLite3 fts5 tokenizer which supports Chinese and PinYin
★ 863+3近 7 天星标变化 - #14
适用于 OpenAI GPT 模型(gpt-5、gpt-o*、gpt-4o 等)的最快 JavaScript BPE Tokenizer 编码解码器。移植自 OpenAI 的 tiktoken 并附加额外功能。
★ 841+2近 7 天星标变化 - #15★ 759+0近 7 天星标变化
- #16
数据标注是一款专门对文本数据进行处理和标注的工具,通过简化快捷的文本标注流程和动态算法反馈,支持用户快速标注关键词,并能通过算法持续减少人工标注的成本和时间。数据标注的过程先由人工标注构建基础,再由自动标注反哺人工标注,最后由人工标注进行纠偏,从而大幅提高标注的精准度和高效性。数据标注需要依赖开源的数字底座进行人员岗位管控。
★ 700+0近 7 天星标变化 - #17
Ekphrasis 是一个文本处理工具,专为来自 Twitter 或 Facebook 等社交网络的文本而设计。Ekphrasis 使用来自两个大型语料库(英文维基百科、Twitter - 3.3亿条英文推文)的单词统计数据,执行标记化、单词规范化、单词分割(用于分割 hashtag)和拼写校正。
★ 673+0近 7 天星标变化 - #18
开源韩文文本处理器 - 一个开源的韩文文本处理器
★ 669+0近 7 天星标变化 - #19★ 667+2近 7 天星标变化
- #20★ 634+1近 7 天星标变化
- #21
逐步实现 llama3 推理、掌握核心概念、掌握过程推导、实现代码。
★ 630+0近 7 天星标变化 - #22
适用于 Python、Go、C++ 与 Javascript 的非贪婪子词分词器与词表训练器
★ 627+0近 7 天星标变化 - #23
NodeJS PHP Parser - 提取 AST 或 Token
★ 565+0近 7 天星标变化 - #24★ 556+0近 7 天星标变化
- #25★ 536-1近 7 天星标变化
- #26★ 529+0近 7 天星标变化
- #27
用于高亮显示嵌套代码块的 VSCode 扩展功能。
★ 512+0近 7 天星标变化