Hoppa till innehållet
Stackship-dokumentation English

ÖvervakningAnvändareMaskinöversatt

Larmregler

Varje inbyggd regel som utlöser ett larm på en resurs, nivån den utlöser, när den slår till och när den löses, och detaljerna som varje larm har med sig.

Varje regel körs en gång i minuten över dina resursers poddar i plattformens eget kluster. Reglerna och deras tröskelvärden är desamma för alla resurser och kan inte ändras. Regelns id är larmets alertId i API:t; namnet är det som portalen visar.

Resursanvändning

Regel Nivå Slår till när Löses när
resource-exhaustion — Resource exhaustion Warning vid 70 % och 80 %, Error vid 90 %, Critical vid 95 % En containers CPU- eller minnesanvändning når den andelen av sin gräns. CPU är den senaste användningen per sekund under de senaste 5 minuterna, minne den senaste avläsningen av arbetsminnet — var och en den senaste avläsningen av containern från någon av dess repliker; det högsta av de två avgör Båda ligger under 70 %
cpu-throttling — CPU throttling Warning över 25 %, Error över 50 % En container hölls tillbaka av sin CPU-gräns i mer än den andelen av sina CPU-schemaläggningsperioder under de senaste 10 minuterna, räknat över alla dess repliker Andelen är 25 % eller lägre
container-oom-killed — Container out of memory Error En container stoppades för att den gick över sin minnesgräns under de senaste 30 minuterna 30 minuter efter den senaste gången

Resource exhaustion och CPU throttling bedömer bara containrar som deklarerar både en CPU- och en minnesgräns. En strypt container kan i genomsnitt använda långt mindre än sin gräns, och därför är strypning en egen regel. En resurs med flera repliker kan visa samma larm Resource exhaustion flera gånger för en container — en gång för varje replik som körde när det öppnades — med samma siffror; kopiorna ändras och löses samtidigt.

Containrar och poddar

Regel Nivå Slår till när Löses när
container-crash-loop — Container crash looping Error En container är i CrashLoopBackOff, eller har startats om minst 3 gånger och dess senaste körning misslyckades — en slutkod som inte är noll eller slut på minne — under de senaste 10 minuterna Ingen replik av containern har misslyckats under de senaste 10 minuterna
container-restarting — Container restarting Warning En container har startats om minst 3 gånger och startades senast om under de senaste 30 minuterna, utan att vara i en kraschloop 30 minuter går utan en omstart
image-pull-failing — Image pull failing Error En container kan inte starta eftersom dess avbild inte kan hämtas: ImagePullBackOff, ErrImagePull eller InvalidImageName. Slår till vid första kontrollen Avbilden hämtas
pod-not-ready — Pod not ready Warning Körande poddar i resursen har inte klarat sin beredskapskontroll på mer än 10 minuter, så trafiken når dem inte. Poddar med en container i kraschloop lämnas till den regeln Ingen körande podd har varit ej redo i mer än 10 minuter: de är redo igen, i kraschloop eller körs inte längre
pod-unschedulable — Pod cannot be scheduled Warning Klustret har inte hittat någon nod för resursens poddar på mer än 5 minuter. Beskrivningen har schemaläggarens meddelande, avkortat till 512 tecken — för lite kapacitet, ingen matchande nod, en taint Poddarna placeras

En container i kraschloop utlöser inte också Container restarting eller Pod not ready; när den slutar krascha men har startats om nyligen kan Container restarting följa på den lägre nivån. En container som hamnar i kraschloop för att minnet tar slut gång på gång utlöser både Container crash looping och Container out of memory. Containerreglerna ger ett larm per container i resursen; poddreglerna ett per resurs.

HTTP-trafik

Regel Nivå Slår till när Löses när
ingress-error-rate — Ingress error rate Warning vid 1 %, Error vid 5 %, Critical vid 25 % Den andelen av förfrågningarna till resursen under de senaste 5 minuterna fick en 5xx-status, och den hade mer än en droppe trafik — se nedan Andelen är under 1 %, eller trafiken sjunker under det golvet

Regeln läser plattformens ingresskontroller. Med nginx bedömer den varje värd och sökväg i resursen för sig; med Traefik resursen som helhet. Den hoppar över en väg vars förfrågningstakt, summerad över varje punkt under de 5 minuterna, blir mindre än 1. Det golvet ligger långt under en förfrågan per sekund, och detaljen totalRps är den summan snarare än en takt.

Livscykel

Regel Nivå Slår till när Löses när
resource-not-updated-90d — Resource not updated in 90 days Warning I den podd i resursen som regeln bedömer startade den senaste föregående körningen av en container för mer än 90 dagar sedan Den starten är 90 dagar gammal eller yngre, till exempel efter en ny driftsättning

Regeln ger ett larm per resurs och bedömer en av dess poddar. Den läser när containrarnas körningar före de nuvarande startade, så den ser bara poddar där en container har startats om minst en gång. En resurs vars containrar har kört utan omstart sedan de driftsattes utlöser den aldrig, hur gamla de än är. Den bedömer bara resurser med minst en container som deklarerar både en CPU- och en minnesgräns.

Detaljer i varje larm

API:t returnerar dessa i larmets metadata:

Regel Detaljer
resource-exhaustion container, cpuPercent, memoryPercent
cpu-throttling container, throttledPercent, cpuLimitCores
container-oom-killed container, exitCode, restartCount, finishedAt, affectedPods
container-crash-loop container, restartCount, lastTerminationReason, lastExitCode, affectedPods
container-restarting container, restartCount, lastTerminationReason, lastExitCode, lastRestartAt, affectedPods
image-pull-failing container, reason, message, affectedPods
pod-not-ready notReadyPods, pods, notReadySince
pod-unschedulable unschedulablePods, pods, reason, message, unschedulableSince
ingress-error-rate errorRatePercent, totalRps, och med nginx host och path
resource-not-updated-90d ageDays, lastUpdatedAt

pods listar högst tio poddnamn, följda av +N more när det finns fler. Larm om själva plattformen — lagring och övervakning — står i Plattformslarm.