requests и BeautifulSoup
Парсер собирает данные со страниц сайта. Для статических страниц достаточно requests (загрузка) и BeautifulSoup (разбор HTML).
Порядок работы
Заголовок раздела «Порядок работы»- Откройте страницу в браузере, посмотрите HTML (F12) и найдите нужные элементы.
- Проверьте
robots.txtи условия сайта. - Загрузите страницу:
requests.get(url, headers=..., timeout=15). - Разберите:
BeautifulSoup(html, "html.parser")иselect("css-селектор"). - Соберите результат в список словарей, сохраните в CSV или Excel.
import requestsfrom bs4 import BeautifulSoup
r = requests.get(url, timeout=15)r.raise_for_status()soup = BeautifulSoup(r.text, "html.parser")items = [a.text.strip() for a in soup.select(".item a")]Типичные ошибки
Заголовок раздела «Типичные ошибки»- Нет
timeout- скрипт зависает. - Селекторы завязаны на случайные классы, которые меняются.
- Нет обработки пустых значений.
Чек-лист
Заголовок раздела «Чек-лист»- Таймауты и обработка ошибок
- Паузы между запросами
- Результат проверен на 20 случайных строках