Larmregler
Varje inbyggd regel som utlöser ett larm på en resurs, nivån den utlöser, när den slår till och när den löses, och detaljerna som varje larm har med sig.
Varje regel körs en gång i minuten över dina resursers poddar i plattformens eget kluster. Reglerna
och deras tröskelvärden är desamma för alla resurser och kan inte ändras. Regelns id är larmets
alertId i API:t; namnet är det som portalen visar.
Resursanvändning
| Regel | Nivå | Slår till när | Löses när |
|---|---|---|---|
resource-exhaustion — Resource exhaustion |
Warning vid 70 % och 80 %, Error vid 90 %, Critical vid 95 % | En containers CPU- eller minnesanvändning når den andelen av sin gräns. CPU är den senaste användningen per sekund under de senaste 5 minuterna, minne den senaste avläsningen av arbetsminnet — var och en den senaste avläsningen av containern från någon av dess repliker; det högsta av de två avgör | Båda ligger under 70 % |
cpu-throttling — CPU throttling |
Warning över 25 %, Error över 50 % | En container hölls tillbaka av sin CPU-gräns i mer än den andelen av sina CPU-schemaläggningsperioder under de senaste 10 minuterna, räknat över alla dess repliker | Andelen är 25 % eller lägre |
container-oom-killed — Container out of memory |
Error | En container stoppades för att den gick över sin minnesgräns under de senaste 30 minuterna | 30 minuter efter den senaste gången |
Resource exhaustion och CPU throttling bedömer bara containrar som deklarerar både en CPU- och en minnesgräns. En strypt container kan i genomsnitt använda långt mindre än sin gräns, och därför är strypning en egen regel. En resurs med flera repliker kan visa samma larm Resource exhaustion flera gånger för en container — en gång för varje replik som körde när det öppnades — med samma siffror; kopiorna ändras och löses samtidigt.
Containrar och poddar
| Regel | Nivå | Slår till när | Löses när |
|---|---|---|---|
container-crash-loop — Container crash looping |
Error | En container är i CrashLoopBackOff, eller har startats om minst 3 gånger och dess senaste körning misslyckades — en slutkod som inte är noll eller slut på minne — under de senaste 10 minuterna |
Ingen replik av containern har misslyckats under de senaste 10 minuterna |
container-restarting — Container restarting |
Warning | En container har startats om minst 3 gånger och startades senast om under de senaste 30 minuterna, utan att vara i en kraschloop | 30 minuter går utan en omstart |
image-pull-failing — Image pull failing |
Error | En container kan inte starta eftersom dess avbild inte kan hämtas: ImagePullBackOff, ErrImagePull eller InvalidImageName. Slår till vid första kontrollen |
Avbilden hämtas |
pod-not-ready — Pod not ready |
Warning | Körande poddar i resursen har inte klarat sin beredskapskontroll på mer än 10 minuter, så trafiken når dem inte. Poddar med en container i kraschloop lämnas till den regeln | Ingen körande podd har varit ej redo i mer än 10 minuter: de är redo igen, i kraschloop eller körs inte längre |
pod-unschedulable — Pod cannot be scheduled |
Warning | Klustret har inte hittat någon nod för resursens poddar på mer än 5 minuter. Beskrivningen har schemaläggarens meddelande, avkortat till 512 tecken — för lite kapacitet, ingen matchande nod, en taint | Poddarna placeras |
En container i kraschloop utlöser inte också Container restarting eller Pod not ready; när den slutar krascha men har startats om nyligen kan Container restarting följa på den lägre nivån. En container som hamnar i kraschloop för att minnet tar slut gång på gång utlöser både Container crash looping och Container out of memory. Containerreglerna ger ett larm per container i resursen; poddreglerna ett per resurs.
HTTP-trafik
| Regel | Nivå | Slår till när | Löses när |
|---|---|---|---|
ingress-error-rate — Ingress error rate |
Warning vid 1 %, Error vid 5 %, Critical vid 25 % | Den andelen av förfrågningarna till resursen under de senaste 5 minuterna fick en 5xx-status, och den hade mer än en droppe trafik — se nedan | Andelen är under 1 %, eller trafiken sjunker under det golvet |
Regeln läser plattformens ingresskontroller. Med nginx bedömer den varje värd och sökväg i resursen
för sig; med Traefik resursen som helhet. Den hoppar över en väg vars förfrågningstakt, summerad över
varje punkt under de 5 minuterna, blir mindre än 1. Det golvet ligger långt under en förfrågan per
sekund, och detaljen totalRps är den summan snarare än en takt.
Livscykel
| Regel | Nivå | Slår till när | Löses när |
|---|---|---|---|
resource-not-updated-90d — Resource not updated in 90 days |
Warning | I den podd i resursen som regeln bedömer startade den senaste föregående körningen av en container för mer än 90 dagar sedan | Den starten är 90 dagar gammal eller yngre, till exempel efter en ny driftsättning |
Regeln ger ett larm per resurs och bedömer en av dess poddar. Den läser när containrarnas körningar före de nuvarande startade, så den ser bara poddar där en container har startats om minst en gång. En resurs vars containrar har kört utan omstart sedan de driftsattes utlöser den aldrig, hur gamla de än är. Den bedömer bara resurser med minst en container som deklarerar både en CPU- och en minnesgräns.
Detaljer i varje larm
API:t returnerar dessa i larmets metadata:
| Regel | Detaljer |
|---|---|
resource-exhaustion |
container, cpuPercent, memoryPercent |
cpu-throttling |
container, throttledPercent, cpuLimitCores |
container-oom-killed |
container, exitCode, restartCount, finishedAt, affectedPods |
container-crash-loop |
container, restartCount, lastTerminationReason, lastExitCode, affectedPods |
container-restarting |
container, restartCount, lastTerminationReason, lastExitCode, lastRestartAt, affectedPods |
image-pull-failing |
container, reason, message, affectedPods |
pod-not-ready |
notReadyPods, pods, notReadySince |
pod-unschedulable |
unschedulablePods, pods, reason, message, unschedulableSince |
ingress-error-rate |
errorRatePercent, totalRps, och med nginx host och path |
resource-not-updated-90d |
ageDays, lastUpdatedAt |
pods listar högst tio poddnamn, följda av +N more när det finns fler. Larm om själva plattformen — lagring och övervakning — står i
Plattformslarm.