scraping
标记 scraping 主题、收录中的开源项目,按星标数排序。
- #61
一个完全翻新与重新设计的分支,基于原版 onlyfans-scraper 从头重新构想
★ 1,153+0近 7 天星标变化 - #62
📰 Newspaper4k,备受喜爱的 Newspaper3k 的分支。从新闻网站提取文章、标题与元数据。
★ 1,141+0近 7 天星标变化 - #63
能将网站转化为 API 的 Agent!
★ 1,121+2近 7 天星标变化 - #64★ 1,116+0近 7 天星标变化
- #65
自动从 Google 电子表格(及其他来源)归档视频、图片和社交媒体内容的链接
★ 1,113+1近 7 天星标变化 - #66
⛏️ Maigret 背后的提取引擎:将任何个人资料 URL 转化为跨越 150 多个网站的结构化 OSINT 记录
★ 1,082+5近 7 天星标变化 - #67
适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本
★ 1,078+5近 7 天星标变化 - #68
🧹 用于文本清理的 Python 软件包
★ 1,028+0近 7 天星标变化 - #69★ 1,022+0近 7 天星标变化
- #70
通过发送带有有效 ChatGPT 抓取 API 凭证的提示词,从 ChatGPT 抓取工具收集结构化响应。只需几个参数即可启用实时搜索、注入 HTML 内容,并自动化智能抓取 ChatGPT 工作流程。
★ 942+153近 7 天星标变化 - #71
📄 将 Notion.so 页面转换为轻量、可自定义的静态网站的 Python 工具
★ 857+0近 7 天星标变化 - #72
一个可自动为 PDF 文件生成目录的 CLI 工具集。
★ 848+0近 7 天星标变化 - #73
简单但实用的 Python 网页爬虫教程代码。
★ 820+0近 7 天星标变化 - #74
自托管爬虫引擎 — 可绕过任何 JS 挑战与验证码:Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTest。作为 FlareSolverr 与 Byparr 的替代方案,可直接替换至您的 *arr 堆栈中。
★ 793+26近 7 天星标变化 - #75
🕵️♂️ 爬取 LinkedIn 个人资料并以 JSON 格式返回结构化数据。
★ 776+0近 7 天星标变化 - #76★ 774+1近 7 天星标变化
- #77
😈📚 专为反检测与网页隐私爱好者策展的研究论文与简报库。
★ 771+2近 7 天星标变化 - #78
通过 SERP API 获取 Google 搜索结果的 Python 软件包
★ 755+2近 7 天星标变化 - #79★ 748+5近 7 天星标变化
- #80
用于抓取房地产数据的 Python 套件
★ 739+2近 7 天星标变化 - #81
Comic-dl 是一个命令行工具,用于从各种漫画网站下载漫画。支持的网站:readcomiconline.to、mangafox.me、comic naver 等等。
★ 676+2近 7 天星标变化 - #82
:card_index: 使用正则表达式提取社交媒体个人资料及更多信息
★ 656+0近 7 天星标变化 - #83★ 636+1近 7 天星标变化
- #84★ 633+22近 7 天星标变化
- #85
用于爬取美国法院网站元数据的 API。
★ 631+3近 7 天星标变化 - #86
Kemono pawchive Downloader 是一款快速的 PyQt5 应用程序,用于从 Kemono、Coomer、Bunkr、Erome、Saint2.su、nhentai 与 Discord 等多种网站存档内容。具备创作者浏览器、更新检查器,并支持多线程与多部分下载。会话可暂停、恢复或复原。
★ 630+10近 7 天星标变化 - #87
在 AWS Lambda 中使用 Python 与 Selenium 进行 Chrome 自动化的最简示例
★ 618+0近 7 天星标变化 - #88
此 Python 应用程序是一个名为“Ominis OSINT - Web Hunter”的 OSINT(开源情报)工具。它通过向 Google 查询与用户输入相关的搜索结果来进行在线信息搜集,并从结果中提取相关信息,例如标题、URL 以及对该查询的潜在提及。
★ 614+2近 7 天星标变化 - #89
用于从 LinkedIn API 转储/抓取/提取公司员工的 Python 3 脚本
★ 611+0近 7 天星标变化 - #90
通用 Reddit 爬虫,适用于任何 Subreddit 或用户。
★ 597+4近 7 天星标变化