-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathscraper_afc.py
More file actions
68 lines (53 loc) · 1.78 KB
/
Copy pathscraper_afc.py
File metadata and controls
68 lines (53 loc) · 1.78 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.chrome.options import Options
import pandas as pd
import time
import requests
import fitz
# Configurar navegador
options = Options()
# options.add_argument("--headless") # Opcional, para correr sin ventana
options.add_argument("--window-size=1920,1080")
driver = webdriver.Chrome(options=options)
# Acceder a la página
driver.get("https://www.previred.com/indicadores-previsionales/")
time.sleep(3)
# Expandir todos los años disponibles
headers = driver.find_elements(By.CLASS_NAME, "accordion__header")
print(f"Encontrados {len(headers)} años.")
for header in headers:
try:
driver.execute_script("arguments[0].scrollIntoView(true);", header)
time.sleep(1)
header.click()
time.sleep(2)
except Exception as e:
print("Error al hacer clic en el año:", e)
# Obtener todos los links a PDF visibles tras expandir
links = driver.find_elements(By.XPATH, "//a[contains(@href, '.pdf')]")
data = []
for link in links:
url = link.get_attribute("href")
texto = link.text.strip()
print(f"Descargando: {texto} | URL: {url}")
try:
response = requests.get(url)
response.raise_for_status()
doc = fitz.open(stream=response.content, filetype="pdf")
pdf_text = ""
for page in doc:
pdf_text += page.get_text()
doc.close()
data.append({
"nombre": texto,
"url": url,
"contenido": pdf_text
})
except Exception as e:
print(f"Error con {url}: {e}")
driver.quit()
# Convertir a DataFrame y guardar
df = pd.DataFrame(data)
df.to_csv("previred_indicadores.csv", index=False)
print("Datos guardados en previred_indicadores.csv")