跳到主要内容
buildradar
登录
主题 · crawler

crawler

标记 crawler 主题、收录中的开源项目,按星标数排序。

共 153 个项目
  • sperm@darbra

    浏览过的精彩逆向文章汇总,值得一看

    1,410+0近 7 天星标变化
  • mlscraper@lorey

    🤖 仅需提供示例即可从 HTML 网站自动抓取数据

    1,386+0近 7 天星标变化
  • crawler@kgspider

    K 哥爬虫代码分享,JS 逆向,爬虫进阶。关注公众号:K哥爬虫

    1,379+0近 7 天星标变化
  • wombat@felipecsl

    轻量级 Ruby 网络爬虫/抓取工具,具有优雅的 DSL,可从页面中提取结构化数据。

    1,360+0近 7 天星标变化
  • XSRFProbe@0xInfection

    顶级的跨站请求伪造(CSRF)审计与利用工具包。

    1,303+0近 7 天星标变化
  • 📝 快速爬取 Instagram 个人档案信息(例如:粉丝、标签等...)。

    1,302+0近 7 天星标变化
  • go-dork@dwisiswant0

    用 Go 语言编写的最快 Dork 扫描器。

    1,302+0近 7 天星标变化
  • boss-zhipin-scraper@eatmoreduck

    Boss直聘爬虫 / BOSS直聘职位数据抓取工具,基于 Chrome CDP 协议复用真实登录态,绕过字体反爬,输出明文薪资 JSON/CSV + 薪资技能分析。A Chrome-CDP-based BOSS Zhipin job scraper/crawler.

    1,282+0近 7 天星标变化
  • Beanbun@kiddyuchina

    Beanbun 是用 PHP 编写的多进程网络爬虫框架,具有良好的开放性、高可扩展性,基于 Workerman。

    1,258+0近 7 天星标变化
  • 一个好用的哔哩哔哩漫画下载器,拥有图形界面,支持关键词搜索漫画和二维码登入,黑科技下载未解锁章节,多线程下载,多种保存格式,本地漫画管理,一键检查更新!

    1,243+0近 7 天星标变化
  • AppCrawler@seveniruby

    基于 appium 的 App 自动遍历工具

    1,237+0近 7 天星标变化
  • tumblr-crawler@dixudx

    轻松下载 tumblr 博客的所有相片/视频。下载指定的 Tumblr 博客中的图片,视频

    1,157+0近 7 天星标变化
  • newspaper4k@AndyTheFactory

    📰 Newspaper4k,备受喜爱的 Newspaper3k 的分支。从新闻网站提取文章、标题与元数据。

    1,141+0近 7 天星标变化
  • fess@codelibs

    基于 OpenSearch 构建的开源、自托管企业与网站搜索服务器。支持网页/文件/数据库/云端来源爬取、20 种以上语言、REST API 以及 AI/RAG 与语义搜索。采用 Apache-2.0 授权。

    1,128+0近 7 天星标变化
  • browsertrix-crawler@webrecorder

    在单一 Docker 容器中执行高保真基于浏览器的网页归档爬虫

    1,127+0近 7 天星标变化
  • crawly@elixir-crawly

    Crawly,一个适用于 Elixir 的高级网络爬虫与数据抓取框架。

    1,116+0近 7 天星标变化
  • kimuraframework@vifreefly

    使用简洁、AI 辅助的 DSL 在 Ruby 中编写网络爬虫。Kimurai 利用 AI 来找出数据所在位置,然后缓存选择器并使用纯 Ruby 进行爬取。获得 LLM 的智慧,而无需付出每次请求的延迟或 Token 成本。

    1,102+0近 7 天星标变化
  • scrapfly-scrapers@scrapfly

    适用于 40 多个热门域名的可扩展 Python 网络爬虫脚本

    1,078+5近 7 天星标变化
  • parse-video@wujunwei928

    Golang短视频去水印:抖音、皮皮虾、火山、微视、最右、快手、全民小视频、皮皮搞笑、西瓜视频、虎牙、梨视频、acfun、好看视频...

    1,035+10近 7 天星标变化
  • wreq@0x676e67

    一个符合人体工学且注重隐私的 Rust HTTP Client

    1,020+11近 7 天星标变化
  • 小说下载、小说爬虫、起点、笔趣阁、导出 Markdown、导出 txt、转换 epub、广告过滤、自动校对

    1,019+5近 7 天星标变化
  • google-play-scraper@JoMingyu

    受 <facundoolano/google-play-scraper> 启发的 Python Google Play 爬虫

    1,010+2近 7 天星标变化
  • Pxer@pea3nut

    一个 pixiv.net 的工具。人人可用的 P 站爬虫

    1,009-1近 7 天星标变化
  • stormcrawler@apache

    基于 Apache Storm 的可扩展、成熟且多功能的网页爬虫

    995+1近 7 天星标变化
  • SpiderSuite@spidersuite

    SpiderSuite(网页安全爬虫)版本发布、wiki 与路线图

    976+4近 7 天星标变化
  • crw@us

    用 Rust 编写的快速、轻量级 Firecrawl/Tavily 替代方案。具备 MCP 服务器的网页爬虫、抓取与搜索 API,专为 AI agent 设计。兼容 Firecrawl API(/scrape、/crawl、/search)。在 1K-URL 效能测试中,比 Tavily 快 2.3 倍、比 Firecrawl 快 1.5 倍。仅需 6 MB RAM、单一执行档。可自架或使用托管云端。

    965+56近 7 天星标变化
  • crawler@fredwu

    基于 Elixir 的高性能网络爬虫 / 抓取器。

    956+0近 7 天星标变化
  • x-kit@xiaoxiunique

    适用于 X.com 的纯 Python 协议工具与研究笔记,包含 VibeLoft Twitter 账号数据集

    940-1近 7 天星标变化
  • icrawler@hellock

    一个多线程爬虫框架,内置多种图片爬虫。

    933+1近 7 天星标变化
  • chatWeb@SkywalkerDarren

    ChatWeb 可以爬取网页、阅读 PDF、DOCX、TXT 并提取主要内容,然后根据内容回答你的问题,或总结重点。

    916+0近 7 天星标变化
← 返回主题列表