
Zyte, Apify y ScrapingBee promueven ahora extracción asistida por IA. La promesa: enviar HTML, recibir JSON estructurado sin escribir selectores específicos por sitio. La realidad: potente pero requiere guardrails.
Nuestro pipeline híbrido: Scrapy recopila HTML en bruto a escala → chunk y limpieza → prompt LLM con esquema JSON → validar salida contra esquema → rechazar/revisión humana de fallos → almacenar registros validados.
Gestión de costes: GPT-4o-mini para campos de alto volumen, GPT-4o para estructuras anidadas complejas. Cache por hash de página para evitar reprocesar páginas sin cambios. Coste típico: $0,001–0,01 por página según tamaño.
Mitigación de alucinaciones: exigir citaciones (spans de texto del HTML fuente), validación de esquema, comprobaciones de consistencia entre campos (precio > 0, fechas parseables) y auditorías humanas por lotes de muestra.
Cuándo gana el LLM: sitios agregadores con plantillas inconsistentes, e-commerce long-tail, hilos de foros, contenido adyacente a PDF. Cuándo ganan las reglas: páginas de producto estables con JSON-LD, endpoints API, formatos de lista repetidos.
Jean Cailleux lidera nuestra I+D de extracción con IA — de datos no estructurados a deep learning, el scraping es un playground maravilloso. Contacta info@scrapy.ninja para pilotar extracción LLM en tus objetivos.


