~/wiki

Data Integrity Risks

Mis à jour le 2026-06-11Confiance : high
data-integrityrace-conditionsdeduplicationconcurrent-operationsbusiness-intelligencecache-corruption

Systematic vulnerabilities in data processing systems that can lead to incorrect, inconsistent, or corrupted information. Critical concern in production business intelligence and data pipeline systems where accuracy directly impacts decision-making.

Common Risk Categories

Race Conditions in Concurrent Operations

Example: Module-level singleton caches overwritten by simultaneous import jobs

  • Multiple data sources importing concurrently
  • Shared cache state between operations
  • Silent degradation of matching accuracy
  • Unpredictable failure modes

Mitigation: Scope caches per operation or use thread-safe data structures

Deduplication Algorithm Instability

Example: Hash-based deduplication using non-deterministic identifiers

  • Array index-based hashing varies between import methods
  • Same logical data produces different hash signatures
  • Duplicate records persist despite deduplication logic
  • Revenue/KPI inflation from duplicate counting

Mitigation: Use deterministic, business-meaningful identifiers for deduplication

Inconsistent Date Handling

Example: Mixing creation dates with business transaction dates

  • API imports use order creation date
  • Business logic expects invoice/transaction date
  • Client classification oscillates between "new" and "inactive"
  • Dashboard metrics become unreliable

Mitigation: Standardize on business-relevant date fields across all import sources

Fallback Logic Gaps

Example: Matching algorithms failing to implement documented fallback behavior

  • Product matching promises fallback lookup but never executes it
  • Coverage limited to subset of data with complete attributes
  • Silent failures reduce system effectiveness
  • Business users unaware of matching gaps

Mitigation: Implement and test all documented fallback paths

Business Impact

Revenue Accuracy

  • Duplicate order counting inflates financial metrics
  • Inaccurate client segmentation affects forecasting
  • Product matching gaps hide true sales patterns
  • Executive dashboards show misleading trends

Operational Reliability

  • Silent failures difficult to detect and debug
  • Data quality degradation over time
  • User trust erosion in business intelligence systems
  • Manual reconciliation overhead

Detection Strategies

Code Review Focus Areas

  • Shared state management in concurrent systems
  • Deterministic behavior of deduplication logic
  • Comprehensive error handling and logging
  • Test coverage for edge cases and failure modes

Monitoring and Validation

  • Data consistency checks across import sources
  • Duplicate detection beyond deduplication logic
  • Business metric validation against known baselines
  • Automated alerting for data anomalies

Real-World Examples

The Archipel Kombucha Project audit revealed multiple data integrity risks:

  • Cache corruption during concurrent Easybeer and Excel imports
  • Deduplication failures allowing revenue double-counting
  • Product matching gaps reducing catalog coverage
  • Date inconsistencies affecting client classification

Prevention Patterns

Design Principles

  • Favor immutable data structures
  • Use deterministic algorithms for critical operations
  • Implement comprehensive logging and auditing
  • Design for testability and verification

Architecture Patterns

  • Event sourcing for audit trails
  • Idempotent operations for safe retries
  • Staged data validation pipelines
  • Separation of concerns between ingestion and processing

See also