crawler
标记 crawler 主题、收录中的开源项目,按星标数排序。
- #91★ 1,410+0近 7 天星标变化
- #92★ 1,386+0近 7 天星标变化
- #93★ 1,379+0近 7 天星标变化
- #94★ 1,360+0近 7 天星标变化
- #95★ 1,303+0近 7 天星标变化
- #96
📝 快速爬取 Instagram 个人档案信息(例如:粉丝、标签等...)。
★ 1,302+0近 7 天星标变化 - #97★ 1,302+0近 7 天星标变化
- #98
Boss直聘爬虫 / BOSS直聘职位数据抓取工具,基于 Chrome CDP 协议复用真实登录态,绕过字体反爬,输出明文薪资 JSON/CSV + 薪资技能分析。A Chrome-CDP-based BOSS Zhipin job scraper/crawler.
★ 1,282+0近 7 天星标变化 - #99★ 1,258+0近 7 天星标变化
- #100
一个好用的哔哩哔哩漫画下载器,拥有图形界面,支持关键词搜索漫画和二维码登入,黑科技下载未解锁章节,多线程下载,多种保存格式,本地漫画管理,一键检查更新!
★ 1,243+0近 7 天星标变化 - #101
基于 appium 的 App 自动遍历工具
★ 1,237+0近 7 天星标变化 - #102
轻松下载 tumblr 博客的所有相片/视频。下载指定的 Tumblr 博客中的图片,视频
★ 1,157+0近 7 天星标变化 - #103
📰 Newspaper4k,备受喜爱的 Newspaper3k 的分支。从新闻网站提取文章、标题与元数据。
★ 1,141+0近 7 天星标变化 - #104
基于 OpenSearch 构建的开源、自托管企业与网站搜索服务器。支持网页/文件/数据库/云端来源爬取、20 种以上语言、REST API 以及 AI/RAG 与语义搜索。采用 Apache-2.0 授权。
★ 1,128+0近 7 天星标变化 - #105
在单一 Docker 容器中执行高保真基于浏览器的网页归档爬虫
★ 1,127+0近 7 天星标变化 - #106★ 1,116+0近 7 天星标变化
- #107
使用简洁、AI 辅助的 DSL 在 Ruby 中编写网络爬虫。Kimurai 利用 AI 来找出数据所在位置,然后缓存选择器并使用纯 Ruby 进行爬取。获得 LLM 的智慧,而无需付出每次请求的延迟或 Token 成本。
★ 1,102+0近 7 天星标变化 - #108
适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本
★ 1,078+5近 7 天星标变化 - #109
Golang短视频去水印:抖音、皮皮虾、火山、微视、最右、快手、全民小视频、皮皮搞笑、西瓜视频、虎牙、梨视频、acfun、好看视频...
★ 1,035+10近 7 天星标变化 - #110★ 1,020+11近 7 天星标变化
- #111
小说下载、小说爬虫、起点、笔趣阁、导出 Markdown、导出 txt、转换 epub、广告过滤、自动校对
★ 1,019+5近 7 天星标变化 - #112
受 <facundoolano/google-play-scraper> 启发的 Python Google Play 爬虫
★ 1,010+2近 7 天星标变化 - #113★ 1,009-1近 7 天星标变化
- #114
基于 Apache Storm 的可扩展、成熟且多功能的网页爬虫
★ 995+1近 7 天星标变化 - #115
SpiderSuite(网页安全爬虫)版本发布、wiki 与路线图
★ 976+4近 7 天星标变化 - #116
用 Rust 编写的快速、轻量级 Firecrawl/Tavily 替代方案。具备 MCP 服务器的网页爬虫、抓取与搜索 API,专为 AI agent 设计。兼容 Firecrawl API(/scrape、/crawl、/search)。在 1K-URL 效能测试中,比 Tavily 快 2.3 倍、比 Firecrawl 快 1.5 倍。仅需 6 MB RAM、单一执行档。可自架或使用托管云端。
★ 965+56近 7 天星标变化 - #117★ 956+0近 7 天星标变化
- #118★ 940-1近 7 天星标变化
- #119★ 933+1近 7 天星标变化
- #120★ 916+0近 7 天星标变化