scraper
标记 scraper 主题、收录中的开源项目,按星标数排序。
- #61
📰 Newspaper4k,备受喜爱的 Newspaper3k 的分支。从新闻网站提取文章、标题与元数据。
★ 1,141+0近 7 天星标变化 - #62★ 1,116+0近 7 天星标变化
- #63
使用简洁、AI 辅助的 DSL 在 Ruby 中编写网络爬虫。Kimurai 利用 AI 来找出数据所在位置,然后缓存选择器并使用纯 Ruby 进行爬取。获得 LLM 的智慧,而无需付出每次请求的延迟或 Token 成本。
★ 1,102+0近 7 天星标变化 - #64
适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本
★ 1,078+5近 7 天星标变化 - #65★ 1,073+5近 7 天星标变化
- #66★ 1,022+1近 7 天星标变化
- #67
一个管理电脑内资源,并提供游戏化的综合管理器
★ 1,020+6近 7 天星标变化 - #68★ 1,020+11近 7 天星标变化
- #69
受 <facundoolano/google-play-scraper> 启发的 Python Google Play 爬虫
★ 1,010+2近 7 天星标变化 - #70
首款匿名查看“Instagram 私密帖子”的工具
★ 996+10近 7 天星标变化 - #71
无需登录或 API 密钥即可获取 X/Twitter 推文、回复、时间轴与文章——专为 AI agents 设计的实地工具。
★ 957+3近 7 天星标变化 - #72★ 956+0近 7 天星标变化
- #73★ 884+2近 7 天星标变化
- #74
一个基于 Kotlin 的测试/抓取/解析库,能够从 HTML(服务端与客户端渲染)中分析并提取数据。它通过提供直观的 DSL,特别强调易用性与高度可读性。旨在成为一个测试库,同时也能以便利的方式用于网页爬虫。
★ 875+1近 7 天星标变化 - #75
使用 CSS、XPath 3.0、XQuery 3.0、JSONiq 或模式匹配从 HTML/XML 页面或 JSON-API 下载并提取数据的命令行工具。它还可以创建新或转换后的 XML/HTML/JSON 文档。
★ 843+0近 7 天星标变化 - #76★ 842+3近 7 天星标变化
- #77
一个通用的同人志与图片库下载器
★ 841+1近 7 天星标变化 - #78
将部分网络小说转换为 epub 格式
★ 840+1近 7 天星标变化 - #79★ 836+0近 7 天星标变化
- #80★ 805+0近 7 天星标变化
- #81
一个国际制裁数据、关注人物与政治公众人物的开放数据库
★ 799+4近 7 天星标变化 - #82
自托管爬虫引擎 — 可绕过任何 JS 挑战与验证码:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作为 FlareSolverr 与 Byparr 的替代方案,可直接替换至您的 *arr 堆栈中。
★ 793+26近 7 天星标变化 - #83
🕵️♂️ 爬取 LinkedIn 个人资料并以 JSON 格式返回结构化数据。
★ 776+0近 7 天星标变化 - #84
operative framework 是一个基于 Rust 的 OSINT 调查框架,您可以与多个目标互动、执行多个模块、建立与目标的链接、将报告导出为 PDF 文件、新增备忘录给目标或结果、与 RESTful API 互动,以及编写您自己的模块。
★ 749-1近 7 天星标变化 - #85
一个用于 Amazon、Aliexpress、ebay 等多个网站及自定义商店的多用户自建价格追踪器。当价格符合用户设定的一或多个条件时接收通知
★ 740+4近 7 天星标变化 - #86
用于抓取房地产数据的 Python 套件
★ 739+2近 7 天星标变化 - #87★ 738+1近 7 天星标变化
- #88
一个用于从 HTML 页面抓取内容的 Scala 库
★ 732+0近 7 天星标变化 - #89★ 730+0近 7 天星标变化
- #90
Twitter 内部 API 文档
★ 712+2近 7 天星标变化