tokenizer
tokenizer 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 tokenizer 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 tokenizer 태그가 달린 리포지토리예요.
최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.
- #1
PyTorch를 사용하여 처음부터 단계별로 ChatGPT와 유사한 LLM 구현하기
★ 104,010+820최근 7일 스타 변화 - #2★ 5,195+0최근 7일 스타 변화
- #3★ 4,067+18최근 7일 스타 변화
- #4★ 4,015+1최근 7일 스타 변화
- #5
JavaScript용 파서 빌딩 툴킷
★ 2,797+0최근 7일 스타 변화 - #6
OpenAPI 토크나이저를 위한 온라인 플레이그라운드
★ 1,678+4최근 7일 스타 변화 - #7★ 1,420+3최근 7일 스타 변화
- #8★ 1,347-1최근 7일 스타 변화
- #9
Node.js 또는 Web Streams 환경에서 최소한의 메모리 점유율로 사용자 정의 JSON 및 JSONC 처리 파이프라인을 구축하기 위한 스트림 컴포넌트 마이크로 라이브러리. SAX 기반 토큰 API를 사용하여 메모리보다 큰 JSON을 파싱, 필터링 및 변환할 수 있습니다.
★ 1,196+1최근 7일 스타 변화 - #10★ 991+3최근 7일 스타 변화
- #11★ 980+1최근 7일 스타 변화
- #12★ 883+1최근 7일 스타 변화
- #13★ 860+0최근 7일 스타 변화
- #14
OpenAI의 GPT 모델(gpt-5, gpt-o*, gpt-4o 등)을 위한 가장 빠른 JavaScript BPE Tokenizer Encoder Decoder. 추가 기능이 포함된 OpenAI tiktoken 포트 버전.
★ 838+3최근 7일 스타 변화 - #15★ 759+1최근 7일 스타 변화
- #16
데이터 어노테이션은 텍스트 데이터를 처리하고 라벨링하기 위해 특별히 설계된 도구입니다. 간소화되고 빠른 텍스트 어노테이션 프로세스와 동적 알고리즘 피드백을 통해 사용자가 키워드를 빠르게 라벨링할 수 있도록 지원하며, 알고리즘을 통해 수동 어노테이션의 비용과 시간을 지속적으로 줄여줍니다. 데이터 어노테이션 과정은 먼저 수동 어노테이션으로 기초를 구축한 다음, 자동 어노테이션이 수동 어노테이션을 보완하고, 마지막으로 수동 어노테이션을 통해 오류를 수정함으로써 어노테이션의 정확성과 효율성을 크게 향상시킵니다. 데이터 어노테이션은 인력의 역할 관리를 위해 오픈소스 디지털 기반에 의존해야 합니다.
★ 699+0최근 7일 스타 변화 - #17
Ekphrasis는 Twitter나 Facebook과 같은 소셜 네트워크 텍스트에 최적화된 텍스트 처리 도구입니다. 두 개의 대규모 말뭉치(영어 Wikipedia, Twitter 트윗 3억 3천만 개)의 통계를 사용하여 토큰화, 단어 정규화, 단어 분할(해시태그 분리용) 및 맞춤법 교정을 수행합니다.
★ 673-1최근 7일 스타 변화 - #18
오픈소스 한국어 텍스트 프로세서
★ 669+0최근 7일 스타 변화 - #19★ 665+4최근 7일 스타 변화
- #20★ 633+0최근 7일 스타 변화
- #21
llama3 추론 과정을 단계별로 학습하고 핵심 개념 파악, 프로세스 유도 및 코드 구현
★ 630-1최근 7일 스타 변화 - #22
Python, Go, C++, Javascript를 위한 탐욕스럽지 않은 서브워드 토크나이저 및 어휘 학습기
★ 627+0최근 7일 스타 변화 - #23
:herb: NodeJS PHP Parser - AST 또는 토큰 추출
★ 565+1최근 7일 스타 변화 - #24★ 556+0최근 7일 스타 변화
- #25★ 537+1최근 7일 스타 변화
- #26★ 530+0최근 7일 스타 변화
- #27
중첩된 코드 블록을 강조 표시하는 VSCode 확장 프로그램
★ 512-1최근 7일 스타 변화