text-extraction
text-extraction 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 text-extraction 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 text-extraction 태그가 달린 리포지토리예요.
최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.
- #1
PDF 검사, 분류 및 텍스트 추출을 위한 빠른 Rust 라이브러리. 스캔본과 텍스트 기반 PDF를 지능적으로 감지하여 스마트 라우팅 결정을 내립니다.
★ 18,547+1,664최근 7일 스타 변화 - #2★ 12,235+39최근 7일 스타 변화
- #3
Rust 코어로 구동되는 다중 언어 문서 지능형 프레임워크. 101개 형식(115개 파일 확장자)에서 텍스트, 메타데이터, 이미지, 구조화된 데이터를 추출하고 371개 프로그래밍 언어에 대한 코드 분석을 지원합니다. Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript 등 15개 언어 바인딩과 CLI, REST API, MCP 서버를 제공합니다.
★ 9,254+21최근 7일 스타 변화 - #4
웹의 텍스트 및 메타데이터 수집을 위한 Python 및 명령줄 도구: 크롤링, 스크래핑, 추출, CSV, JSON, HTML, MD, TXT, XML 출력 지원
★ 6,754+26최근 7일 스타 변화 - #5★ 3,703+1최근 7일 스타 변화
- #6★ 3,109+1최근 7일 스타 변화
- #7
Tika-Python은 Apache Tika™ REST 서비스에 대한 Python 바인딩으로, Python 커뮤니티에서 Tika를 네이티브로 호출할 수 있게 해줍니다.
★ 1,667+0최근 7일 스타 변화 - #8
Python 및 Rust를 위한 가장 빠른 PDF 라이브러리. 텍스트 추출, 이미지 추출, 마크다운 변환, PDF 생성 및 편집 지원. 평균 0.8ms, 업계 선두 대비 5배 빠름, 3,830개 PDF 테스트 100% 통과. MIT/Apache-2.0 라이선스.
★ 1,015+11최근 7일 스타 변화 - #9★ 921+1최근 7일 스타 변화
- #10
비전 LLM을 사용하여 PDF를 markdown으로 변환 — 표, 레이아웃 및 구조 보존
★ 902+1최근 7일 스타 변화 - #11
고성능의 CommonMark 호환 HTML to Markdown 변환기. Rust 코어 기반의 다국어 문서 인텔리전스 엔진인 Kreuzberg 팀에서 유지 관리하며, 스트리밍 파서와 내장 OCR을 통해 98개 이상의 문서 형식에서 구조화된 데이터를 추출함
★ 863+4최근 7일 스타 변화 - #12★ 823-1최근 7일 스타 변화
- #13★ 756+1최근 7일 스타 변화
- #14★ 554+0최근 7일 스타 변화
- #15★ 536+0최근 7일 스타 변화