Websites in Daten verwandeln

Strukturierte Daten extrahieren mit JSON-LD und Schema.org

Strukturierte Daten extrahieren mit JSON-LD und Schema.org

Erfahrene Scraper kennen ein Geheimnis: Viele Sites publizieren bereits strukturierte Daten für Google Rich Results. JSON-LD-Blöcke in `<script type="application/ld+json">`-Tags enthalten saubere Product-, Article-, LocalBusiness- und Organization-Schemas.

JSON-LD zu extrahieren ist schneller und stabiler als XPath. Produktseiten enthalten typisch Name, Preis, Währung, Verfügbarkeit, Marke und SKU in einem Parse. Layout-Redesigns brechen CSS-Selektoren; Schema überlebt oft.

Implementierung in Scrapy: Pipeline-Schritt hinzufügen, der ld+json-Skripte sucht, mit Pythons json-Modul parst und schema.org-Typen auf Ihr Item-Modell mappt. Fallback auf HTML-Selektoren, wenn JSON-LD fehlt oder unvollständig ist.

Achtung: mehrere JSON-LD-Blöcke pro Seite (BreadcrumbList + Product), @graph-Arrays und ungültiges JSON durch Template-Fehler. Mit jsonschema gegen erwartete Typen validieren.

Bei Scrapy Ninja ist JSON-LD-Extraktion unsere erste Strategie für E-Commerce- und News-Kunden. Sie senkt Wartungskosten, wenn Sites ihre UI erneuern — ein häufiger Schmerzpunkt bei Langzeit-Scrapern.

Kontaktieren Sie uns per E-Mail

Wir antworten in der Regel innerhalb von 6 Stunden.

info@scrapy.ninja