본문으로 건너뛰기
buildradar
Sign in
토픽 · tokenizer

tokenizer

tokenizer 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
27
총 스타
138,329
평균 스타
5,123
비중
0.01%

같은 리포지토리에 tokenizer 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 tokenizer 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • LLMs-from-scratch@rasbt

    PyTorch를 사용하여 처음부터 단계별로 ChatGPT와 유사한 LLM 구현하기

    104,010+820최근 7일 스타 변화
  • tokenizer@theseer

    토큰화된 PHP 소스 코드를 XML(및 잠재적으로 기타 형식)로 변환하기 위한 소형 라이브러리입니다.

    5,195+0최근 7일 스타 변화
  • gigatoken@marcelroed

    GB/s 급의 언어 모델 토큰화

    4,067+18최근 7일 스타 변화
  • sqlparse@andialbrecht

    Python을 위한 검증 기능이 없는 SQL 파서 모듈

    4,015+1최근 7일 스타 변화
  • chevrotain@Chevrotain

    JavaScript용 파서 빌딩 툴킷

    2,797+0최근 7일 스타 변화
  • tiktokenizer@dqbd

    OpenAPI 토크나이저를 위한 온라인 플레이그라운드

    1,678+4최근 7일 스타 변화
  • hazm@roshan-research

    페르시아어 NLP 툴킷

    1,420+3최근 7일 스타 변화
  • natasha@natasha

    기본적인 러시아어 NLP 작업을 해결하고 하위 수준의 Natasha 프로젝트를 위한 API 제공

    1,347-1최근 7일 스타 변화
  • stream-json@uhop

    Node.js 또는 Web Streams 환경에서 최소한의 메모리 점유율로 사용자 정의 JSON 및 JSONC 처리 파이프라인을 구축하기 위한 스트림 컴포넌트 마이크로 라이브러리. SAX 기반 토큰 API를 사용하여 메모리보다 큰 JSON을 파싱, 필터링 및 변환할 수 있습니다.

    1,196+1최근 7일 스타 변화
  • soynlp@lovit

    한국어 자연어처리를 위한 파이썬 라이브러리입니다. 단어 추출/ 토크나이저 / 품사판별/ 전처리의 기능을 제공합니다.

    991+3최근 7일 스타 변화
  • kagome@ikawaha

    순수 Go로 작성된 자체 포함형 일본어 형태소 분석기

    980+1최근 7일 스타 변화
  • moo@no-context

    최적화된 토크나이저/렉서 생성기. 성능을 위해 /y를 사용합니다.

    883+1최근 7일 스타 변화
  • simple@wangfenjin

    중국어 및 병음(Pinyin)을 지원하는 SQLite fts5 전문 검색 확장

    860+0최근 7일 스타 변화
  • gpt-tokenizer@niieani

    OpenAI의 GPT 모델(gpt-5, gpt-o*, gpt-4o 등)을 위한 가장 빠른 JavaScript BPE Tokenizer Encoder Decoder. 추가 기능이 포함된 OpenAI tiktoken 포트 버전.

    838+3최근 7일 스타 변화
  • Wordless@BLKSerene

    언어, 문학 및 번역 연구를 위한 다국어 지원 통합 코퍼스 도구입니다.

    759+1최근 7일 스타 변화
  • Data-Labeling@risesoft-y9

    데이터 어노테이션은 텍스트 데이터를 처리하고 라벨링하기 위해 특별히 설계된 도구입니다. 간소화되고 빠른 텍스트 어노테이션 프로세스와 동적 알고리즘 피드백을 통해 사용자가 키워드를 빠르게 라벨링할 수 있도록 지원하며, 알고리즘을 통해 수동 어노테이션의 비용과 시간을 지속적으로 줄여줍니다. 데이터 어노테이션 과정은 먼저 수동 어노테이션으로 기초를 구축한 다음, 자동 어노테이션이 수동 어노테이션을 보완하고, 마지막으로 수동 어노테이션을 통해 오류를 수정함으로써 어노테이션의 정확성과 효율성을 크게 향상시킵니다. 데이터 어노테이션은 인력의 역할 관리를 위해 오픈소스 디지털 기반에 의존해야 합니다.

    699+0최근 7일 스타 변화
  • ekphrasis@cbaziotis

    Ekphrasis는 Twitter나 Facebook과 같은 소셜 네트워크 텍스트에 최적화된 텍스트 처리 도구입니다. 두 개의 대규모 말뭉치(영어 Wikipedia, Twitter 트윗 3억 3천만 개)의 통계를 사용하여 토큰화, 단어 정규화, 단어 분할(해시태그 분리용) 및 맞춤법 교정을 수행합니다.

    673-1최근 7일 스타 변화
  • open-korean-text@open-korean-text

    오픈소스 한국어 텍스트 프로세서

    669+0최근 7일 스타 변화
  • lindera@lindera

    다국어 형태소 분석 라이브러리.

    665+4최근 7일 스타 변화
  • jflex@jflex-de

    전체 Unicode를 지원하는 Java용 고속 스캐너 생성기

    633+0최근 7일 스타 변화
  • Deepdive-llama3-from-scratch@therealoliver

    llama3 추론 과정을 단계별로 학습하고 핵심 개념 파악, 프로세스 유도 및 코드 구현

    630-1최근 7일 스타 변화
  • tokenmonster@alasdairforsythe

    Python, Go, C++, Javascript를 위한 탐욕스럽지 않은 서브워드 토크나이저 및 어휘 학습기

    627+0최근 7일 스타 변화
  • php-parser@glayzzle

    :herb: NodeJS PHP Parser - AST 또는 토큰 추출

    565+1최근 7일 스타 변화
  • js-tokens@lydell

    경량 JavaScript 토크나이저

    556+0최근 7일 스타 변화
  • fugashi@polm

    빠르고 파이썬다운 일본어 토큰화 및 형태소 분석을 위한 Cython MeCab 래퍼입니다.

    537+1최근 7일 스타 변화
  • UniTok@FoundationVision

    [NeurIPS 2025 Spotlight] 시각적 생성 및 이해를 위한 통합 토크나이저

    530+0최근 7일 스타 변화
  • vscode-blockman@leodevbro

    중첩된 코드 블록을 강조 표시하는 VSCode 확장 프로그램

    512-1최근 7일 스타 변화
← 토픽 목록으로