跳到主要內容
buildradar
Sign in
主題 · data-extraction

data-extraction

標記 data-extraction 主題、收錄中的開源專案,依星數排序。

專案數
28
總星數
343,727
平均星數
12,276
佔比
0.02%

常跟 data-extraction 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 data-extraction 主題的專案。

  • ai-data-extractor@bawadou

    免費開源的 AI 程式設計助手對話紀錄提取工具。支援 Claude Code、Cursor、Windsurf、Aider、Cline/Roo Code 等

    555
  • firecrawl@firecrawl

    提供大規模搜尋、抓取與互動的 Context API。🔥

    175,781+1,747近 7 天星數變化
  • Scrapling@D4Vinci

    🕷️ 一個自適應的網路爬蟲框架,能處理單一請求到全規模爬取的所有需求!

    78,099+941近 7 天星數變化
  • Scrapegraph-ai@ScrapeGraphAI

    基於 AI 的 Python 抓取工具

    30,435+388近 7 天星數變化
  • maxun@getmaxun

    🔥 開源無程式碼平台,用於網頁爬取、爬蟲、搜尋與 AI 資料抽取 • 只需數分鐘即可將網站轉換為結構化 API 🔥

    17,349+27近 7 天星數變化
  • ferret@MontFerret

    宣告式資料自動化語言與 Go 執行環境,用於結構化抽取工作流程。

    6,009+1近 7 天星數變化
  • flashtext@vi3k6i5

    从句子中提取关键词或替换句子中的关键词

    5,709-3近 7 天星數變化
  • skills@browser-act

    Browser automation CLI built for AI agents. Break through anti-bot walls, hand off to humans across platforms when stuck. Parallel multi-task execution, independent multi-session operation, isolated multi-account browsing.

    5,549+27近 7 天星數變化
  • brightdata-mcp@brightdata

    一款強大的 Model Context Protocol (MCP) 伺服器,為公開網路存取提供全方位解決方案。

    2,624+10近 7 天星數變化
  • HeadlessX@saifyxpro

    無法被偵測的自架瀏覽器自動化平台。由 Camoufox (Firefox) 驅動,實現 0% 偵測率。為速度、隱私與可擴展性而打造。

    2,279+7近 7 天星數變化
  • recipe-scrapers@hhursev

    用於爬取食譜資料的 Python 套件

    2,218+2近 7 天星數變化
  • contextgem@shcherbak-ai

    ContextGem:輕鬆從文件中進行 LLM 萃取

    1,996+1近 7 天星數變化
  • article-extractor@extractus

    從給定的 URL 擷取文章

    1,911+1近 7 天星數變化
  • optimus@hi-primus

    :truck: 透過 Pandas、Dask、cuDF、Dask-cuDF、Vaex 與 PySpark 輕鬆實現敏捷資料準備工作流程。

    1,536+0近 7 天星數變化
  • vnstock@thinh-vu

    一個對新手友好且功能強大的 Python 財務分析與自動化工具包 — 旨在讓現代投資人人都能上手

    1,391+3近 7 天星數變化
  • parsera@raznem

    使用 LLM 進行網站爬蟲的輕量級函式庫

    1,353+3近 7 天星數變化
  • socid-extractor@soxoj

    ⛏️ Maigret 背後的擷取引擎:將任何個人檔案 URL 轉化為跨越 150 多個網站的結構化 OSINT 記錄

    1,081+5近 7 天星數變化
  • pdf_oxide@yfedoseev

    適用於 Python 與 Rust 的最快 PDF 函式庫。支援文字萃取、圖片萃取、Markdown 轉換、PDF 建立與編輯。平均 0.8ms,比業界領導者快 5 倍,3,830 個 PDF 測試 100% 通過率。採用 MIT/Apache-2.0 授權。

    1,017+13近 7 天星數變化
  • crw@us

    用 Rust 寫的快速、輕量級 Firecrawl/Tavily 替代方案。具備 MCP 伺服器的網頁爬蟲、抓取與搜尋 API,專為 AI agent 設計。相容 Firecrawl API(/scrape、/crawl、/search)。在 1K-URL 效能測試中,比 Tavily 快 2.3 倍、比 Firecrawl 快 1.5 倍。僅需 6 MB RAM、單一執行檔。可自架或使用託管雲端。

    955+90近 7 天星數變化
  • eclaire@eclaire-labs

    本機優先、開源的資料 AI 助理。整合任務、筆記、文件、相片與書籤。具備隱私、自我主機架設,並可透過 API 擴充。

    918+6近 7 天星數變化
  • hacker-news-digest@polyrabbit

    :newspaper: 讓 ChatGPT 為你總結 Hacker News

    756+0近 7 天星數變化
  • ai-web-scraper@ScrapingBee

    Effortlessly extract data with our AI scraper API. Simplify data extraction, get clean JSON outputs and adapt to page changes. Try it free today!

    724+155近 7 天星數變化
  • npm-pdfreader@adrienjoly

    🚜 從 PDF 檔案中解析文字與表格。

    704+0近 7 天星數變化
  • scrapecraft@ScrapeGraphAI

    🤖 具備視覺化工作流程建構器的 AI 網頁爬蟲編輯器。透過自然語言建構、測試與部署網頁爬蟲。由 ScrapeGraphAI 與 LangGraph 驅動。

    695+11近 7 天星數變化
  • Google Reviews API 整合與可擴展的 Google Reviews 爬蟲,用於從 Google Maps 提取評分、評論文字和商業洞察

    594+0近 7 天星數變化
  • Stealth-Requests@jpjacobpadilla

    Python 中隱蔽的網頁爬蟲與無縫 HTML 解析工具!

    563+2近 7 天星數變化
  • github-statuses@mrshu

    「遺失的 GitHub 狀態頁面」—— 一項嘗試以 Flat Data 記錄 GitHub 歷史狀態的專案

    562+1近 7 天星數變化
  • reader@vakra-dev

    用於 AI 的開源網頁基礎設施。支援網頁抓取、爬蟲、自動化、Markdown 清理與瀏覽器工作階段,為你的 Agent 做好準備。

    559+1近 7 天星數變化
  • ai-data-extractor@bawadou

    免費開源的 AI 程式設計助手對話紀錄提取工具。支援 Claude Code、Cursor、Windsurf、Aider、Cline/Roo Code 等

    555+6近 7 天星數變化
← 返回主題列表