Narzędzie do crawlowania i analizy treści
Project description
Crawl Toolkit
Narzędzie do crawlowania i analizy treści, które integruje się z BrightData do crawlowania stron internetowych i OpenAI do analizy treści.
Instalacja
pip install crawl-toolkit
Wymagania
- Python 3.8+
- Klucz API BrightData (SERP i Crawler)
- Klucz API OpenAI
Przykład użycia
from crawl_toolkit import CrawlToolkit, Language, FetchType
# Inicjalizacja
toolkit = CrawlToolkit(
brightdata_serp_key="your_serp_key",
brightdata_serp_zone="your_serp_zone",
brightdata_crawl_key="your_crawl_key",
brightdata_crawl_zone="your_crawl_zone",
openai_key="your_openai_key"
)
# Pobieranie najlepszych URL-i dla słowa kluczowego
urls = await toolkit.get_top_urls(
keyword="python programming",
max_results=20,
language=Language.ENGLISH
)
# Pobieranie i czyszczenie treści (różne strategie)
contents_classic = await toolkit.fetch_and_clean_urls(
urls=urls,
strategy="classic" # klasyczne czyszczenie HTML
)
contents_crawl4ai = await toolkit.fetch_and_clean_urls(
urls=urls,
strategy="crawl4ai" # zaawansowane czyszczenie przez crawl4ai
)
contents_markdown = await toolkit.fetch_and_clean_urls(
urls=urls,
strategy="markdown" # czyszczenie markdown
)
# Analiza słów kluczowych
analysis = await toolkit.make_keyword_analysis(
keyword="python programming",
max_urls=20,
language=Language.ENGLISH
)
# Analiza z nagłówkami
analysis_with_headers = await toolkit.make_keyword_analysis_and_headers(
keyword="python programming",
max_urls=20,
language=Language.ENGLISH
)
Funkcjonalności
- Pobieranie najlepszych URL-i z Google dla danego słowa kluczowego
- Pobieranie i czyszczenie treści z podanych URL-i
- Analiza słów kluczowych z użyciem OpenAI
- Wyodrębnianie nagłówków z treści
- Obsługa wielu języków
- Czyszczenie treści HTML i Markdown
Strategie czyszczenia treści
classic– klasyczne czyszczenie HTML (HtmlCleaner)crawl4ai– zaawansowane czyszczenie i konwersja do markdown przez crawl4aimarkdown– czyszczenie treści markdown
Licencja
MIT
Project details
Release history Release notifications | RSS feed
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
crawl_toolkit-0.1.3.tar.gz
(19.2 kB
view details)
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file crawl_toolkit-0.1.3.tar.gz.
File metadata
- Download URL: crawl_toolkit-0.1.3.tar.gz
- Upload date:
- Size: 19.2 kB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.1.0 CPython/3.10.14
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
069ae2878d12b4f592dd5feeb861bf0b4804e97405681b1bef4fcd93c380b62c
|
|
| MD5 |
20c6d51bd183a20cdb557f3de87670bc
|
|
| BLAKE2b-256 |
09601b9b241c3068c917033c90a4d72430f3aba3e751b9f8006e2ae968b9eb85
|
File details
Details for the file crawl_toolkit-0.1.3-py3-none-any.whl.
File metadata
- Download URL: crawl_toolkit-0.1.3-py3-none-any.whl
- Upload date:
- Size: 23.7 kB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.1.0 CPython/3.10.14
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
e51cec4a37197dc9c57317ee0e4e9be887e5ff5539e97571febc482b03b64349
|
|
| MD5 |
2fb39aa1cf7ed10261dd01f6b0145f44
|
|
| BLAKE2b-256 |
2c14a8f1bcf33adfbe3ca1237d1fbc2d9cfda325af40ab9ffc81c9453a188527
|