El web scraping consiste en extraer información automáticamente de páginas web. Python destaca en esta tarea gracias a la combinación de dos librerías: requests, que descarga el contenido HTML de cualquier página, y BeautifulSoup, que permite recorrer y extraer elementos concretos de ese HTML de forma sencilla.
Es importante mencionar que antes de hacer scraping a cualquier sitio web conviene revisar su archivo robots.txt y sus términos de servicio, ya que no todas las páginas permiten la extracción automatizada de su contenido.
Código de ejemplo:
import requests
from bs4 import BeautifulSoup
url = "https://ejemplo.com"
respuesta = requests.get(url)
soup = BeautifulSoup(respuesta.text, "html.parser")
titulos = soup.find_all("h2")
for titulo in titulos:
print(titulo.text.strip())
# Instalación: pip install requests beautifulsoup4
.png)
No hay comentarios:
Publicar un comentario
Se procedera a revision para su pronta publicacion en caso de que no incumpla las normas de blogger.