본문으로 건너뛰기
buildradar
Sign in
토픽 · corpus-data

corpus-data

corpus-data 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
3
총 스타
5,976
평균 스타
1,992
비중
0.00%

같은 리포지토리에 corpus-data 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 corpus-data 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • MNBVC@esbatmop

    MNBVC(Massive Never-ending BT Vast Chinese corpus) 초대규모 중국어 말뭉치. ChatGPT 학습용 40T 데이터에 준함. MNBVC 데이터셋은 주류 문화뿐만 아니라 다양한 닉네임 문화와 외계어 데이터도 포함합니다. 뉴스, 작문, 소설, 서적, 잡지, 논문, 대사, 게시물, wiki, 시, 가사, 상품 소개, 농담, 채팅 기록 등 모든 형태의 순수 텍스트 중국어 데이터를 포함합니다.

    4,272+4최근 7일 스타 변화
  • 대규모 언어 모델(LLM) 학습에 사용되는 ChatGPT 중국어 말뭉치, 대화 말뭉치, 소설 말뭉치, 고객센터 말뭉치

    965+1최근 7일 스타 변화
  • poetry@sheepzh

    지구상에서 가장 방대한 현대 중문 시 데이터셋, 3천 명 이상의 시인, 8만 편 이상의 시, 1,500만 자 이상 수록

    740+1최근 7일 스타 변화
← 토픽 목록으로