
Les données scrapées brutes sont rarement prêtes client. Encodage, entités HTML, dates incohérentes, doublons, placeholders ("N/A") polluent les datasets.
Pipeline standard : Extract → Normalize → Validate → Dedupe → Deliver. Chaque étape a des checks auto et triggers review humaine.
Exemples normalisation : prix en float + devise, dates ISO 8601, téléphones E.164, adresses géocodées. Validation JSON Schema — fail si >2% violations.
Dédup : hash exact ; fuzzy titre+lieu pour annonces ; fenêtre temporelle pour news.
Formats livraison : CSV, JSON, JSONL, Parquet, PostgreSQL, API REST, webhooks. Formats multiples pendant validation client.
Scrapy Ninja garantit des données propres — pas des dumps HTML. Demandez un échantillon au devis.


