IntegrationAdvancedplatform-eventsreplayrecovery
Design Platform Event replay recovery after subscriber extended outage
Real World Scenario
Kafka consumer down 18 hours misses Platform Events; on restart earliest replay reprocesses week of events duplicating warehouse loads.
Expected Answer
• Store last processed ReplayId durable external to consumer pod
• On recovery subscribe from last ReplayId plus one not earliest
• Gap detection: compare ReplayId sequence alert missing range
• Bulk API catch-up for missed records if replay window expired
• Idempotent warehouse merge handles replay overlap
• Replay retention window document SLA subscriber max downtime
• Runbook subscriber rebuild from CDC baseline plus incremental
Follow-Up Questions & Answers
Click to expand — each follow-up includes a direct, interview-ready answer
Main difference: use case and scale. Store last processed ReplayId durable external to consumer pod. On recovery subscribe from last ReplayId plus one not earliest. Pick based on your integration pattern and team capability. Replay without stored cursor duplicates or gaps—external ReplayId persistence is production requirement. Optimize for scale and operational observability.
Architect Perspective
Replay without stored cursor duplicates or gaps—external ReplayId persistence is production requirement.