spider
Repositorios de código abierto monitorizados etiquetados con spider, ordenados por estrellas.
- #31★ 2463+0Variación de estrellas de los últimos 7 días
- #32
🕷 CrawlerDetect es una clase PHP para detectar bots/crawlers/spiders a través del user agent
★ 2403+2Variación de estrellas de los últimos 7 días - #33
Descarga imágenes de Google, Bing y Baidu.
★ 2360-2Variación de estrellas de los últimos 7 días - #34
Framework de rastreo web en C# multiplataforma diseñado para ofrecer velocidad y flexibilidad. ¡Por favor, dale una estrella a este proyecto! +1.
★ 2310+0Variación de estrellas de los últimos 7 días - #35
SkyBlue (BlueSky Collector) es un sistema de rastreo web de código abierto y gratuito. Solo requiere hacer clic y editar reglas para recopilar datos. Puede ejecutarse de forma local, en hosting virtual o en servidores en la nube, es capaz de rastrear casi todo tipo de páginas web, se integra sin problemas con varios programas CMS para la creación de sitios web, publica datos en tiempo real sin necesidad de iniciar sesión y funciona de forma totalmente automática sin intervención humana. Es un software de rastreo web en la nube totalmente multiplataforma para macrodatos.
★ 2088-1Variación de estrellas de los últimos 7 días - #36★ 2019+0Variación de estrellas de los últimos 7 días
- #37★ 1891+3Variación de estrellas de los últimos 7 días
- #38★ 1879+2Variación de estrellas de los últimos 7 días
- #39
Escáner de aplicaciones web basado en Python para recopilar OSINT y realizar pruebas de vulnerabilidades OWASP en un sitio web objetivo.
★ 1820-1Variación de estrellas de los últimos 7 días - #40
QQ空间导出助手,用于备份QQ空间的说说、日志、私密日记、相册、视频、留言板、QQ好友、收藏夹、分享、最近访客为文件,便于迁移与保存
★ 1815+13Variación de estrellas de los últimos 7 días - #41
Web scrapers en Python: incluye extracción de música de NetEase Cloud, videos de Bilibili, preguntas de Zhihu, fondos de pantalla, videos de xvideos, audiolibros, Weibo, datos de Anjuke con visualización, extractor de portadas de Bilibili, pool de proxies IP, análisis de datos de usuarios de Zhihu y scrapers de usuarios de GitHub
★ 1649+4Variación de estrellas de los últimos 7 días - #42
Rastreador web para archivistas: salida WARC, panel de control para todos los rastreos y patrones de ignorar dinámicos.
★ 1609+2Variación de estrellas de los últimos 7 días - #43
Rastreador de Douyin: recopila datos públicos de perfiles, me gusta, favoritos, audio original, temas, búsquedas, colecciones, publicaciones, seguidores y seguidos.
★ 1605+1Variación de estrellas de los últimos 7 días - #44★ 1410+0Variación de estrellas de los últimos 7 días
- #45
Compartición de código de scraping del hermano K, ingeniería inversa de JS, scraping avanzado. Sigue la cuenta oficial: K哥爬虫
★ 1379+0Variación de estrellas de los últimos 7 días - #46
📰 Diarios oficiales brasileños accesibles para todos
★ 1375+1Variación de estrellas de los últimos 7 días - #47
El kit de herramientas principal para la auditoría y explotación de falsificación de peticiones en sitios cruzados (CSRF).
★ 1303+1Variación de estrellas de los últimos 7 días - #48
Una herramienta de descarga para extraer libros electrónicos de Internet.
★ 1294+0Variación de estrellas de los últimos 7 días - #49
Herramienta de scraping para ofertas de empleo en BOSS Zhipin, basada en el protocolo Chrome CDP para reutilizar estados de inicio de sesión, eludir protecciones de fuentes y exportar datos en JSON/CSV con análisis de habilidades salariales.
★ 1282+33Variación de estrellas de los últimos 7 días - #50
Beanbun es un framework de web scraping multiproceso escrito en PHP, altamente abierto y escalable, basado en Workerman.
★ 1258-1Variación de estrellas de los últimos 7 días - #51
50 notas sobre modelos grandes de lenguaje (LLM). Este repositorio contiene proyectos prácticos en los campos de aprendizaje automático, aprendizaje profundo, visión por computadora, procesamiento de lenguaje natural, LLM y web scraping.
★ 1118+3Variación de estrellas de los últimos 7 días - #52★ 1116+2Variación de estrellas de los últimos 7 días
- #53★ 1104+2Variación de estrellas de los últimos 7 días
- #54
Extraer artículos de cuentas oficiales de WeChat
★ 1079+4Variación de estrellas de los últimos 7 días - #55
Scripts de web scraping en Python escalables para más de 40 dominios populares.
★ 1077+5Variación de estrellas de los últimos 7 días - #56
Ingeniería inversa y descifrado de JS, descifrado de parámetros de cifrado anti-scraping de JS, incluyendo Geetest, QQ Music, Pinduoduo, Boss Zhipin, Zhihu, Kugou, Vipshop, China Judgements Online, Taobao, Tianan Insurance, Bilibili, Fang.com, WPS, Weibo, Youdao, NetEase, WeChat, Kongzhong, Jintong, sistemas de gestión escolar, etc.
★ 1035+0Variación de estrellas de los últimos 7 días - #57
Eliminación de marcas de agua de videos cortos en Golang: Douyin, Pipixia, Huoshan, Weishi, Zuiyou, Kuaishou, Quanmin, Pipigaoxiao, Xigua, Huya, Pear Video, AcFun, Haokan, etc.
★ 1032+11Variación de estrellas de los últimos 7 días - #58
Descarga y extracción de novelas, soporte para Qidian y Biquge, exportación a Markdown y txt, conversión a epub, filtrado de anuncios y corrección automática
★ 1018+9Variación de estrellas de los últimos 7 días - #59★ 998+0Variación de estrellas de los últimos 7 días
- #60
Lanzamientos, wiki y hoja de ruta de SpiderSuite (rastreador de seguridad web)
★ 975+1Variación de estrellas de los últimos 7 días