Convierta sitios web en datos

Extracción de datos estructurados con JSON-LD y Schema.org

Extracción de datos estructurados con JSON-LD y Schema.org

Los scrapers experimentados conocen un secreto: muchos sitios ya publican datos estructurados para Google Rich Results. Los bloques JSON-LD en etiquetas `<script type="application/ld+json">` contienen esquemas limpios de Product, Article, LocalBusiness y Organization.

Extraer JSON-LD es más rápido y estable que XPath. Las páginas de producto suelen incluir nombre, precio, moneda, disponibilidad, marca y SKU en un solo parse. Los rediseños de layout rompen selectores CSS; el schema a menudo sobrevive.

Implementación en Scrapy: añade un paso de pipeline que busque scripts ld+json, parsee con el módulo json de Python y mapee tipos schema.org a tu modelo de item. Fallback a selectores HTML cuando JSON-LD esté ausente o incompleto.

Cuidado con: múltiples bloques JSON-LD por página (BreadcrumbList + Product), arrays @graph y JSON inválido por errores de plantilla. Valida con jsonschema contra tipos esperados.

En Scrapy Ninja, la extracción JSON-LD es nuestra primera estrategia para clientes e-commerce y noticias. Reduce el coste de mantenimiento cuando los sitios refrescan su UI — un dolor habitual en scrapers de larga duración.

Contáctenos por email

Normalmente respondemos en menos de 6 horas.

info@scrapy.ninja