Skip to main content

Narzędzie do crawlowania i analizy treści

Project description

Crawl Toolkit

Narzędzie do crawlowania i analizy treści, które integruje się z BrightData do crawlowania stron internetowych i OpenAI do analizy treści.

Instalacja

pip install crawl-toolkit

Wymagania

  • Python 3.8+
  • Klucz API BrightData (SERP i Crawler)
  • Klucz API OpenAI

Przykład użycia

from crawl_toolkit import CrawlToolkit, Language, FetchType

# Inicjalizacja
toolkit = CrawlToolkit(
    brightdata_serp_key="your_serp_key",
    brightdata_serp_zone="your_serp_zone",
    brightdata_crawl_key="your_crawl_key",
    brightdata_crawl_zone="your_crawl_zone",
    openai_key="your_openai_key"
)

# Pobieranie najlepszych URL-i dla słowa kluczowego
urls = await toolkit.get_top_urls(
    keyword="python programming",
    max_results=20,
    language=Language.ENGLISH
)

# Pobieranie i czyszczenie treści (różne strategie)
contents_classic = await toolkit.fetch_and_clean_urls(
    urls=urls,
    strategy="classic"  # klasyczne czyszczenie HTML
)
contents_crawl4ai = await toolkit.fetch_and_clean_urls(
    urls=urls,
    strategy="crawl4ai"  # zaawansowane czyszczenie przez crawl4ai
)
contents_markdown = await toolkit.fetch_and_clean_urls(
    urls=urls,
    strategy="markdown"  # czyszczenie markdown
)

# Analiza słów kluczowych
analysis = await toolkit.make_keyword_analysis(
    keyword="python programming",
    max_urls=20,
    language=Language.ENGLISH
)

# Analiza z nagłówkami
analysis_with_headers = await toolkit.make_keyword_analysis_and_headers(
    keyword="python programming",
    max_urls=20,
    language=Language.ENGLISH
)

Funkcjonalności

  • Pobieranie najlepszych URL-i z Google dla danego słowa kluczowego
  • Pobieranie i czyszczenie treści z podanych URL-i
  • Analiza słów kluczowych z użyciem OpenAI
  • Wyodrębnianie nagłówków z treści
  • Obsługa wielu języków
  • Czyszczenie treści HTML i Markdown

Strategie czyszczenia treści

  • classic – klasyczne czyszczenie HTML (HtmlCleaner)
  • crawl4ai – zaawansowane czyszczenie i konwersja do markdown przez crawl4ai
  • markdown – czyszczenie treści markdown

Licencja

MIT

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

crawl_toolkit-0.1.3.tar.gz (19.2 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

crawl_toolkit-0.1.3-py3-none-any.whl (23.7 kB view details)

Uploaded Python 3

File details

Details for the file crawl_toolkit-0.1.3.tar.gz.

File metadata

  • Download URL: crawl_toolkit-0.1.3.tar.gz
  • Upload date:
  • Size: 19.2 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.1.0 CPython/3.10.14

File hashes

Hashes for crawl_toolkit-0.1.3.tar.gz
Algorithm Hash digest
SHA256 069ae2878d12b4f592dd5feeb861bf0b4804e97405681b1bef4fcd93c380b62c
MD5 20c6d51bd183a20cdb557f3de87670bc
BLAKE2b-256 09601b9b241c3068c917033c90a4d72430f3aba3e751b9f8006e2ae968b9eb85

See more details on using hashes here.

File details

Details for the file crawl_toolkit-0.1.3-py3-none-any.whl.

File metadata

  • Download URL: crawl_toolkit-0.1.3-py3-none-any.whl
  • Upload date:
  • Size: 23.7 kB
  • Tags: Python 3
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.1.0 CPython/3.10.14

File hashes

Hashes for crawl_toolkit-0.1.3-py3-none-any.whl
Algorithm Hash digest
SHA256 e51cec4a37197dc9c57317ee0e4e9be887e5ff5539e97571febc482b03b64349
MD5 2fb39aa1cf7ed10261dd01f6b0145f44
BLAKE2b-256 2c14a8f1bcf33adfbe3ca1237d1fbc2d9cfda325af40ab9ffc81c9453a188527

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page