Als Tierhalterinnen und Tierhalter, die ein Unternehmen aufgebaut haben, das durch Verständnis für bessere Versorgung sorgen möchte, wissen wir, wie wichtig es ist, sich auf die Produkte verlassen zu können, die bei der Pflege unserer Tiere helfen. Am Dienstag, dem 11. August, kam es bei unserer Petlibro-App zu einem Ausfall, der einen erheblichen Teil unserer Kundschaft betraf. Das Problem wurde am Mittwochabend, dem 12. August, vollständig behoben. Wir entschuldigen uns aufrichtig für die Störung und verstehen die Frustration und Besorgnis, die sie verursacht hat. Wir möchten transparent machen, was passiert ist, und noch wichtiger: Ihnen mitteilen, welche Schritte wir jetzt unternehmen. Wir ergreifen sofort zusätzliche Maßnahmen, um unser System zu stärken und zu verhindern, dass ein ähnliches Problem künftig erneut auftritt.
Ausblick
Wir werden uns weiterhin an hohen Standards messen lassen und sind entschlossen, aus dieser Situation zu lernen.
-
Wir haben das Problem untersucht, die zugrunde liegende Ursache behoben und die Kapazität zur Bewältigung der Nachfrage erhöht.
-
Unsere Krisen-Taskforce erarbeitet ein Prüfprotokoll, um unser Backend zu durchsuchen und ähnliche Unstimmigkeiten zu beheben.
-
Wir werden weiterhin Folgeprobleme untersuchen, die durch den Ausfall verursacht wurden, und unsere Systeme mit geeigneten Lösungen aktualisieren.
-
Wir werden weiterhin Meldungen prüfen, wonach ein Gerät eine Routine nicht wie erwartet ausgeführt hat, um genau zu verstehen, was passiert ist.
-
Die Statusseite für unsere Dienste wird dauerhaft in unsere Website integriert, damit Nutzerinnen und Nutzer jederzeit den Status unserer App und Server überprüfen können.
-
Wir werden unser Kundensupport-Team aufstocken, um den durch den Ausfall entstandenen Rückstau an Support-Tickets schneller abzuarbeiten.
Was passiert ist
Der Ausfall war auf Probleme mit den Cloud-Servern zurückzuführen, die zu einem Rückstau von Datenanfragen führten, den Systemspeicher überlasteten und dabei den Geräteservice zum Erliegen brachten. Nach erfolgreichem Neustart des Cloud-Dienstes trat der Rückstau erneut auf, und das System fiel wieder aus. Daraufhin führte das Team eine systematische Fehlerbehebung des Cloud-Dienstsystems durch, identifizierte die zugrunde liegende Ursache, spielte eine Lösung ein und überwachte dann den langsamen Anstieg des Datenverkehrs bis zur stabilen Erholung genau.
Aufgrund dieses Ausfalls konnte die App keine Verbindung mehr zu den Geräten herstellen, sodass eine Kommunikation mit den Geräten nicht mehr möglich war. Mit der App verbundene Dienste – darunter manuelle Aktionen, Betriebsverlauf, Aufzeichnungen, Benachrichtigungen und Videos – waren nicht verfügbar.
Nachfolgend finden Sie eine detailliertere Zeitübersicht. Alle Zeiten sind in pazifischer Zeit (PT) angegeben. Bitte beachten Sie, dass unser Team während dieser gesamten Zeit rund um die Uhr an einer Lösung gearbeitet hat.
-
11. August:
-
5:20 Uhr: Es trat ein kritischer Fehler auf, der die Anmeldung und Steuerung der App beeinträchtigte.
-
6:30 Uhr: Die Funktionalität der App wurde wiederhergestellt, und das System begann, einen großen Rückstau an Datenanfragen zu verarbeiten, der durch den Ausfall entstanden war.
-
6:53 Uhr: Eine Flut eingehender Anfragen überlastete die Verbindungskapazität, und das System fiel erneut aus.
-
8:04 Uhr: Die grundlegenden Funktionen wurden wiederhergestellt, und der Service wurde schrittweise hochgefahren, um auf mögliche verbleibende Probleme zu achten.
-
9:07 Uhr: Als weitere Funktionen online gingen, verlangsamte sich die Ladezeit der App, und wir entschieden uns, den Funktionsumfang vorübergehend zu reduzieren.
-
20:04 Uhr: Im Laufe des Tages wurde der Dienst immer wieder kurzzeitig wiederhergestellt, bevor er erneut abstürzte. Das Entwicklungsteam identifizierte ein Cache-Problem und deaktivierte den Dienst, um es zu beheben.
-
23:43 Uhr: Eine Lösung für das Cache-Problem wurde implementiert und der Dienst reaktiviert.
-
12. August:
-
11:05 Uhr: Im Laufe der Nacht wurde der Geräteservice schrittweise wiederhergestellt, bis wir eine normale Konnektivität erreichten.
-
16:51 Uhr: Die Anfragelast kehrte auf das Niveau vor dem Ausfall zurück und war wieder normal stabil.
-
19:39 Uhr: Nachdem das Team den stabilen Betrieb der App über einen Spitzenlastzyklus hinweg beobachtet hatte, setzte es den Status des Ausfalls auf „behoben“. Weitere Patches sollten während der Nebenverkehrszeiten veröffentlicht werden, ohne die Nutzungserfahrung zu beeinträchtigen.
Unsere Reaktion
Sobald der Fehler erkannt wurde, haben wir sofort unser Krisenreaktionsteam aktiviert. Unsere erste Maßnahme bestand darin, den Service der App so schnell wie möglich wiederherzustellen, um Unannehmlichkeiten zu minimieren. Nachdem der Dienst zunächst wiederhergestellt war, haben wir in einer Mitteilung die Behebung angekündigt, mussten diese jedoch zurückziehen, als die App erneut ausfiel. Wir haben alles versucht, um die Funktionalität ohne Unterbrechung des Dienstes wiederherzustellen, mussten aber die schwierige Entscheidung treffen, die App zu pausieren, nachdem wir alle anderen Möglichkeiten ausgeschöpft hatten.
Nachdem unser Team die zugrunde liegende Ursache identifiziert und eine Lösung implementiert hatte, stellten wir den Dienst Schritt für Schritt wieder her, um die Stabilität der gepatchten Lösung zu überwachen. Im Laufe der Nacht beobachteten wir die Leistung weiter, während sich mehr Geräte wieder verbanden, bevor wir am nächsten Morgen das Niveau vor dem Ausfall erreichten. Obwohl ein Großteil des Dienstes zu diesem Zeitpunkt wiederhergestellt war, arbeiteten wir weiterhin im Krisenmodus, bis wir einen vollständigen Nachfragezyklus erleben konnten, um eine gleichbleibende Leistung zu gewährleisten.
Gleichzeitig informierte unser Team Kunden und andere Stakeholder fortlaufend über den Prozess. Während des Ausfalls verschickte unser Team fünf E-Mails an aktive Kunden mit verbundenen Geräten, veröffentlichte vier Updates auf Reddit und Instagram und aktivierte eine Statusseite auf unserer Website mit direktem Link von der Startseite. Wenn die App in Betrieb war, zeigten wir außerdem Pop-ups mit relevanten Informationen an, damit Sie jederzeit nachsehen konnten, was gerade passierte.
Da sich die Erholung fortsetzt, sind wir uns bewusst, dass der Ausfall Folgeprobleme ausgelöst haben könnte. In vielen Fällen war die Geräteverbindung unbeständig, und wir beobachten diese Fälle. In den meisten Fällen hat ein manueller Neustart des Geräts das Problem behoben. Unsere Produkte sind so konzipiert, dass sie vorgeplante Routinen wie Fütterung und Selbstreinigung eigenständig und unabhängig von der App ausführen. Dies funktionierte bei der großen Mehrheit der Geräte. Wir prüfen derzeit aktiv vereinzelte Meldungen, wonach eine Routine möglicherweise nicht wie erwartet ausgeführt wurde, um festzustellen, ob dabei sekundäre Faktoren eine Rolle gespielt haben.
Nochmals: Wir entschuldigen uns aufrichtig für die Unannehmlichkeiten und den Frust, die dadurch entstanden sind, und wir unternehmen alle Anstrengungen, um unsere Produkte auf Grundlage dieses Vorfalls zu verbessern. Wir werden Sie weiterhin über unsere laufenden Maßnahmen zum Ausfall und die nächsten Schritte informieren. Vielen Dank für Ihre Geduld in dieser Woche und für Ihr Vertrauen, wenn es um Ihre Tiere geht. Wir nehmen diese Verantwortung ernst.
Diese Mitteilung dient dazu, Sie über unsere Fortschritte zu informieren. Ihre Rechte als geschätzte Kundin bzw. geschätzter Kunde bleiben hiervon unberührt.