
Les scrapers expérimentés connaissent un secret : beaucoup de sites publient déjà des données structurées pour Google Rich Results. Les blocs JSON-LD dans `<script type="application/ld+json">` contiennent Product, Article, LocalBusiness propres.
Extraire le JSON-LD est plus rapide et stable que XPath. Les pages produit incluent nom, prix, devise, stock, marque, SKU en un parse. Les refontes UI cassent les sélecteurs CSS ; le schema survit souvent.
Implémentation Scrapy : pipeline qui cherche les scripts ld+json, parse avec json, mappe les types schema.org. Fallback HTML si JSON-LD absent.
Attention : blocs multiples (BreadcrumbList + Product), tableaux @graph, JSON invalide. Validez avec jsonschema.
Chez Scrapy Ninja, JSON-LD est notre première stratégie e-commerce et news. Ça réduit la maintenance quand les sites rafraîchissent leur UI.


