scraping
scraping がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #61
オリジナルの onlyfans-scraper をベースにゼロから完全に刷新・再設計されたフォークプロジェクト
★ 1,153+0直近 7 日のスター増減 - #62
ニュースサイトから記事、タイトル、メタデータを抽出する、親しまれているNewspaper3kのフォーク版「Newspaper4k」
★ 1,141+0直近 7 日のスター増減 - #63
ウェブサイトをAPIに変換するエージェント!
★ 1,121+2直近 7 日のスター増減 - #64★ 1,116+0直近 7 日のスター増減
- #65
Google スプレッドシートなどから動画、画像、SNSコンテンツのリンクを自動的にアーカイブします。
★ 1,113+1直近 7 日のスター増減 - #66
⛏️ Maigret の背景にある抽出エンジン:任意のプロフィール URL を 150 以上のサイトにわたる構造化された OSINT レコードに変換する
★ 1,082+5直近 7 日のスター増減 - #67
40以上の人気ドメインに対応したスケーラブルなPythonウェブスクレイピングスクリプト
★ 1,078+5直近 7 日のスター増減 - #68
🧹 テキストクリーニング用の Python パッケージ。
★ 1,028+0直近 7 日のスター増減 - #69★ 1,022+0直近 7 日のスター増減
- #70
有効な ChatGPT スクレイピング API 認証情報を使用してプロンプトを送信し、ChatGPT スクレイパーから構造化された応答を収集します。わずか数個のパラメータでライブ検索を有効にし、HTML コンテキストを注入し、インテリジェントなスクレイパー ChatGPT ワークフローを自動化します。
★ 942+153直近 7 日のスター増減 - #71
📄 Notion.so のページを軽量でカスタマイズ可能な静的ウェブサイトに変換する Python ツール
★ 857+0直近 7 日のスター増減 - #72
PDF ファイルの目次を自動生成する CLI ツールセット
★ 848+0直近 7 日のスター増減 - #73
シンプルで実用的なPythonウェブスクレイピングチュートリアルコード
★ 820+0直近 7 日のスター増減 - #74
セルフホスト型のスクレイピングエンジン。Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTestなどのJSチャレンジやCAPTCHAを回避します。FlareSolverrやByparrの代替となり、*arrスタックにそのまま組み込んで置き換えることが可能です。
★ 793+26直近 7 日のスター増減 - #75
LinkedInのプロフィール情報をスクレイピングし、構造化されたJSONデータとして返すツール
★ 776+0直近 7 日のスター増減 - #76★ 774+1直近 7 日のスター増減
- #77
😈📚 検出回避とウェブプライバシー愛好家のための、厳選された研究論文およびプレゼンテーションのライブラリ
★ 771+2直近 7 日のスター増減 - #78
SERP API を使用した Google 検索結果取得用 Python パッケージ
★ 755+2直近 7 日のスター増減 - #79★ 748+5直近 7 日のスター増減
- #80
不動産データをスクレイピングするためのPythonパッケージ
★ 739+2直近 7 日のスター増減 - #81
Comic-dlは、様々なサイトからマンガやコミックをダウンロードするためのコマンドラインツールです。対応サイト:readcomiconline.to、mangafox.me、comic naverなど多数。
★ 676+2直近 7 日のスター増減 - #82
:card_index: 正規表現を使用してソーシャルメディアのプロフィールなどを抽出します
★ 656+0直近 7 日のスター増減 - #83
データスクレイピング、cronジョブ、メール送信、デプロイなどを1本の動画で学びながら、ウェブスクレイピングに飛び込み Next.js 13 eCommerce 価格トラッカーを構築する。
★ 636+1直近 7 日のスター増減 - #84
マルチエージェントチーム向けのサンドボックス化されたコラボレーション:各エージェントを個別の使い捨てサンドボックスに隔離した、Git バックエンドのメッセージフォーラム。認証情報やホストへのアクセスを共有せずに、マシン間で連携できます。
★ 633+22直近 7 日のスター増減 - #85
アメリカの裁判所のウェブサイトからメタデータをスクレイピングするためのAPI。
★ 631+3直近 7 日のスター増減 - #86
Kemono pawchive Downloader は、Kemono、Coomer、Bunkr、Erome、Saint2.su、nhentai、Discord など、さまざまなサイトからコンテンツをアーカイブするための高速な PyQt5 アプリです。クリエーターブラウザやアップデートチェッカーを備え、マルチスレッドおよびマルチパートダウンロードをサポートしています。セッションの一時停止、再開、復元が可能で、フィルター機能も備えています。
★ 630+10直近 7 日のスター増減 - #87
AWS Lambda上でPythonとSeleniumを使用したChrome自動化の最もシンプルなデモ
★ 618+0直近 7 日のスター増減 - #88
この Python アプリケーションは、「Ominis OSINT - Web Hunter」と呼ばれる OSINT(公開情報収集)ツールです。ユーザーが入力したクエリに関連する検索結果を Google に問い合わせてオンライン情報収集を行います。タイトル、URL、結果内のクエリの潜在的な言及などの関連情報を抽出します。
★ 614+2直近 7 日のスター増減 - #89
LinkedIn APIから企業の従業員データをダンプ/スクレイピング/抽出するPython 3スクリプト
★ 611+0直近 7 日のスター増減 - #90
ユニバーサル Reddit スクレイパー - あらゆるサブレディットやユーザーに対応
★ 597+4直近 7 日のスター増減