crawler
Repositorios de código abierto monitorizados etiquetados con crawler, ordenados por estrellas.
- #91★ 1410+0Variación de estrellas de los últimos 7 días
- #92★ 1386+1Variación de estrellas de los últimos 7 días
- #93
Compartición de código de scraping del hermano K, ingeniería inversa de JS, scraping avanzado. Sigue la cuenta oficial: K哥爬虫
★ 1379+0Variación de estrellas de los últimos 7 días - #94
Rastreador/scraper web ligero en Ruby con un DSL elegante para extraer datos estructurados de páginas.
★ 1360+0Variación de estrellas de los últimos 7 días - #95
El kit de herramientas principal para la auditoría y explotación de falsificación de peticiones en sitios cruzados (CSRF).
★ 1303+1Variación de estrellas de los últimos 7 días - #96
📝 Rastrea rápidamente la información (por ejemplo, seguidores, etiquetas, etc.) de un perfil de Instagram.
★ 1302+1Variación de estrellas de los últimos 7 días - #97★ 1302+0Variación de estrellas de los últimos 7 días
- #98
Herramienta de scraping para ofertas de empleo en BOSS Zhipin, basada en el protocolo Chrome CDP para reutilizar estados de inicio de sesión, eludir protecciones de fuentes y exportar datos en JSON/CSV con análisis de habilidades salariales.
★ 1282+33Variación de estrellas de los últimos 7 días - #99
Beanbun es un framework de web scraping multiproceso escrito en PHP, altamente abierto y escalable, basado en Workerman.
★ 1258-1Variación de estrellas de los últimos 7 días - #100
Un descargador de cómics de Bilibili con interfaz gráfica, soporte para búsqueda por palabras clave, inicio de sesión con código QR, descarga de capítulos bloqueados, descarga multihilo, múltiples formatos de guardado, gestión local y actualización con un clic
★ 1243+1Variación de estrellas de los últimos 7 días - #101
Herramienta de recorrido automático de aplicaciones basada en Appium
★ 1237+0Variación de estrellas de los últimos 7 días - #102
Descarga fácilmente todas las fotos y videos de los blogs de Tumblr.
★ 1157+0Variación de estrellas de los últimos 7 días - #103
Newspaper4k, un fork del popular Newspaper3k para la extracción de artículos, títulos y metadatos de sitios web de noticias.
★ 1141+1Variación de estrellas de los últimos 7 días - #104
Servidor de búsqueda empresarial y de sitios de código abierto y autohospedado basado en OpenSearch. Rastrea fuentes web, archivos, bases de datos y la nube, con soporte para más de 20 idiomas, API REST, IA/RAG y búsqueda semántica. Licencia Apache-2.0.
★ 1128+1Variación de estrellas de los últimos 7 días - #105
Ejecuta un crawler de archivo web de alta fidelidad basado en navegador dentro de un único contenedor Docker.
★ 1127+5Variación de estrellas de los últimos 7 días - #106★ 1116+2Variación de estrellas de los últimos 7 días
- #107
Desarrollo de scrapers web en Ruby mediante un DSL limpio asistido por IA. Kimurai utiliza IA para identificar la ubicación de los datos, almacena selectores en caché y realiza el scraping con Ruby puro, obteniendo la inteligencia de un LLM sin la latencia ni los costos por token de cada solicitud.
★ 1102+0Variación de estrellas de los últimos 7 días - #108
Scripts de web scraping en Python escalables para más de 40 dominios populares.
★ 1076+4Variación de estrellas de los últimos 7 días - #109
Eliminación de marcas de agua de videos cortos en Golang: Douyin, Pipixia, Huoshan, Weishi, Zuiyou, Kuaishou, Quanmin, Pipigaoxiao, Xigua, Huya, Pear Video, AcFun, Haokan, etc.
★ 1032+10Variación de estrellas de los últimos 7 días - #110
Descarga y extracción de novelas, soporte para Qidian y Biquge, exportación a Markdown y txt, conversión a epub, filtrado de anuncios y corrección automática
★ 1017+8Variación de estrellas de los últimos 7 días - #111★ 1017+12Variación de estrellas de los últimos 7 días
- #112
Scraper de Google Play para Python inspirado en <facundoolano/google-play-scraper>
★ 1010+2Variación de estrellas de los últimos 7 días - #113★ 1009-1Variación de estrellas de los últimos 7 días
- #114
Un rastreador web escalable, maduro y versátil basado en Apache Storm
★ 994+1Variación de estrellas de los últimos 7 días - #115
Lanzamientos, wiki y hoja de ruta de SpiderSuite (rastreador de seguridad web)
★ 974+1Variación de estrellas de los últimos 7 días - #116★ 956+0Variación de estrellas de los últimos 7 días
- #117
Alternativa rápida y ligera a Firecrawl/Tavily escrita en Rust. Web scraper, crawler y API de búsqueda con servidor MCP para agentes de IA. API compatible con Firecrawl (/scrape, /crawl, /search). 2.3 veces más rápido que Tavily y 1.5 veces más rápido que Firecrawl en benchmarks de 1000 URLs. 6 MB de RAM, binario único. Autohospedable o mediante nube gestionada.
★ 955+87Variación de estrellas de los últimos 7 días - #118
Herramientas de protocolo en Python puro y notas de investigación para X.com, con conjuntos de datos de la cuenta de Twitter de VibeLoft.
★ 940-1Variación de estrellas de los últimos 7 días - #119★ 933+1Variación de estrellas de los últimos 7 días
- #120
ChatWeb puede rastrear páginas web, leer archivos PDF, DOCX y TXT, extraer el contenido principal y responder preguntas basadas en dicho contenido o resumir los puntos clave.
★ 916+0Variación de estrellas de los últimos 7 días