
Zyte, Apify und ScrapingBee werben jetzt für AI-unterstützte Extraktion. Das Versprechen: HTML senden, strukturiertes JSON ohne site-spezifische Selektoren erhalten. Die Realität: mächtig, aber Guardrails nötig.
Unsere hybride Pipeline: Scrapy sammelt rohes HTML in Scale → chunken und bereinigen → LLM-Prompt mit JSON-Schema → Output gegen Schema validieren → Failures ablehnen/human review → validierte Records speichern.
Kostenmanagement: GPT-4o-mini für High-Volume-Felder, GPT-4o für komplexe verschachtelte Strukturen. Cache per Page Hash, um unveränderte Seiten nicht neu zu verarbeiten. Typische Kosten: $0,001–0,01 pro Seite je nach Größe.
Halluzinations-Mitigation: Zitate verlangen (Text-Spans aus Quell-HTML), Schema-Validierung, Cross-Field-Konsistenzchecks (Preis > 0, parsebare Daten) und stichprobenartige Human-Audit-Batches.
Wann LLM gewinnt: Aggregator-Sites mit inkonsistenten Templates, Long-Tail-E-Commerce, Forum-Threads, PDF-nahe Inhalte. Wann Rules gewinnen: stabile Produktseiten mit JSON-LD, API-Endpoints, wiederholte Listenformate.
Jean Cailleux leitet unsere AI-Extraktions-F&E — von unstrukturierten Daten bis Deep Learning ist Scraping ein wunderbares Spielfeld. Kontakt info@scrapy.ninja, um LLM-Extraktion auf Ihren Zielen zu pilotieren.


