跳到主要内容
buildradar
Sign in
主题 · data-extraction

data-extraction

标记 data-extraction 主题、收录中的开源项目,按星标数排序。

项目数
28
总星标数
343,727
平均星标数
12,276
占比
0.02%

常跟 data-extraction 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 data-extraction 主题的项目。

  • ai-data-extractor@bawadou

    免费开源的 AI 编程助手对话记录提取工具。支持 Claude Code、Cursor、Windsurf、Aider、Cline/Roo Code 等

    555
  • firecrawl@firecrawl

    提供大规模搜索、抓取与交互的 Context API。🔥

    175,781+1,747近 7 天星标变化
  • Scrapling@D4Vinci

    🕷️ 一个自适应的网络爬虫框架,能够处理单一请求到全规模爬取的所有需求!

    78,099+941近 7 天星标变化
  • Scrapegraph-ai@ScrapeGraphAI

    基于 AI 的 Python 抓取工具

    30,435+388近 7 天星标变化
  • maxun@getmaxun

    🔥 开源无代码平台,用于网页爬取、爬虫、搜索与 AI 数据抽取 • 只需几分钟即可将网站转化为结构化 API 🔥

    17,349+27近 7 天星标变化
  • ferret@MontFerret

    声明式数据自动化语言与 Go 运行时,用于结构化抽取工作流。

    6,009+1近 7 天星标变化
  • flashtext@vi3k6i5

    从句子中提取关键词或替换句子中的关键词

    5,709-3近 7 天星标变化
  • skills@browser-act

    Browser automation CLI built for AI agents. Break through anti-bot walls, hand off to humans across platforms when stuck. Parallel multi-task execution, independent multi-session operation, isolated multi-account browsing.

    5,549+27近 7 天星标变化
  • brightdata-mcp@brightdata

    一款强大的 Model Context Protocol (MCP) 服务器,为公开网络访问提供全方位解决方案。

    2,624+10近 7 天星标变化
  • HeadlessX@saifyxpro

    无法被检测的自托管浏览器自动化平台。由 Camoufox (Firefox) 驱动,实现 0% 检测率。为速度、隐私与可扩展性而打造。

    2,279+7近 7 天星标变化
  • recipe-scrapers@hhursev

    用于爬取食谱数据的 Python 软件包

    2,218+2近 7 天星标变化
  • contextgem@shcherbak-ai

    ContextGem:轻松从文件中进行 LLM 提取

    1,996+1近 7 天星标变化
  • article-extractor@extractus

    从给定的 URL 提取文章

    1,911+1近 7 天星标变化
  • optimus@hi-primus

    :truck: 通过 Pandas、Dask、cuDF、Dask-cuDF、Vaex 和 PySpark 轻松实现敏捷数据准备工作流程。

    1,536+0近 7 天星标变化
  • vnstock@thinh-vu

    一个对新手友好且功能强大的 Python 财务分析与自动化工具包 — 旨在让现代投资人人都能上手

    1,391+3近 7 天星标变化
  • parsera@raznem

    使用 LLM 进行网站爬虫的轻量级库

    1,353+3近 7 天星标变化
  • socid-extractor@soxoj

    ⛏️ Maigret 背后的提取引擎:将任何个人资料 URL 转化为跨越 150 多个网站的结构化 OSINT 记录

    1,081+5近 7 天星标变化
  • pdf_oxide@yfedoseev

    适用于 Python 与 Rust 的最快 PDF 库。支持文字提取、图片提取、Markdown 转换、PDF 创建与编辑。平均 0.8ms,比业界领导者快 5 倍,3,830 个 PDF 测试 100% 通过率。采用 MIT/Apache-2.0 授权。

    1,017+13近 7 天星标变化
  • crw@us

    用 Rust 编写的快速、轻量级 Firecrawl/Tavily 替代方案。具备 MCP 服务器的网页爬虫、抓取与搜索 API,专为 AI agent 设计。兼容 Firecrawl API(/scrape、/crawl、/search)。在 1K-URL 效能测试中,比 Tavily 快 2.3 倍、比 Firecrawl 快 1.5 倍。仅需 6 MB RAM、单一执行档。可自架或使用托管云端。

    955+90近 7 天星标变化
  • eclaire@eclaire-labs

    本地优先、开源的资料 AI 助理。整合任务、笔记、文档、照片与书签。具备隐私、自托管,并可通过 API 扩展。

    918+6近 7 天星标变化
  • hacker-news-digest@polyrabbit

    :newspaper: 让 ChatGPT 为你总结 Hacker News

    756+0近 7 天星标变化
  • ai-web-scraper@ScrapingBee

    Effortlessly extract data with our AI scraper API. Simplify data extraction, get clean JSON outputs and adapt to page changes. Try it free today!

    706+155近 7 天星标变化
  • npm-pdfreader@adrienjoly

    🚜 从 PDF 文件中解析文字与表格。

    704+0近 7 天星标变化
  • scrapecraft@ScrapeGraphAI

    🤖 具备可视化工作流程构建器的 AI 网页爬虫编辑器。通过自然语言构建、测试与部署网页爬虫。由 ScrapeGraphAI 与 LangGraph 驱动。

    695+11近 7 天星标变化
  • Google Reviews API 集成与可扩展的 Google Reviews 爬虫,用于从 Google Maps 提取评分、评论文本和商业洞察

    594+0近 7 天星标变化
  • Stealth-Requests@jpjacobpadilla

    Python 中隐蔽的网页爬虫与无缝 HTML 解析工具!

    563+2近 7 天星标变化
  • github-statuses@mrshu

    「遗失的 GitHub 状态页面」—— 一项尝试以 Flat Data 记录 GitHub 历史状态的项目

    562+1近 7 天星标变化
  • reader@vakra-dev

    用于 AI 的开源网页基础设施。支持网页抓取、爬虫、自动化、Markdown 清理与浏览器会话,为你的 Agent 做好准备。

    559+1近 7 天星标变化
  • ai-data-extractor@bawadou

    免费开源的 AI 编程助手对话记录提取工具。支持 Claude Code、Cursor、Windsurf、Aider、Cline/Roo Code 等

    555+6近 7 天星标变化
← 返回主题列表