Hoppa till innehållet
Stackship-dokumentation English

ÖvervakningAdministratörerMaskinöversatt

Plattformslarm

Larmen om själva plattformen — lagring, övervakning och tillstånd som andra plattformskomponenter rapporterar — var de visas, hur de lämnar klustret och varför inget larmmejl kommer fram.

Plattformslarm gäller plattformen snarare än en kunds resurs. De hör inte till någon boundary, visas aldrig i en kunds larmlistor, och visas under Aktiva plattformslarm på fliken Noder på sidan Hälsa, som kräver monitoring/platform/read på roten. De öppnas, ändras och löses på samma sätt som resurslarm — se Larm.

Listan levereras också av GET /admin/monitoring/alerts: de aktiva larmen, eller med includeResolved=true även de lösta som fortfarande sparas, högst 200.

Lagring

De här reglerna läser Longhorns mätvärden och är tysta i ett kluster utan Longhorn. Deras tröskelvärden beror på två Longhorn-inställningar som övervakningsmodulen måste få veta — se Longhorn.

Regel Nivå Slår till när
storage-scheduling-headroom — Storage scheduling headroom low Warning, Critical En nods reserverade lagring har legat över 75 % av vad Longhorn kan schemalägga på den under de senaste 15 minuterna; Critical över 90 % under de senaste 5 minuterna. Vad den kan schemalägga är nodens kapacitet minus reserverat utrymme, gånger procentsatsen för överallokering. När det är förbrukat kan nya volymer inte placeras
storage-disk-space — Storage disk nearly full Warning, Critical En disks lediga utrymme, när den var som fullast under de senaste 15 minuterna, ligger mindre än 5 procentenheter över procentsatsen för minsta tillgängliga utrymme; Critical när det ligger mindre än 1 enhet över. Med standardvärdena: under 30 % och under 26 % ledigt
storage-node-ready — Storage node not ready, Storage disk not ready Critical Longhorn har rapporterat en nod eller en disk som inte redo under hela de senaste 5 minuterna. Den bidrar inte med någon lagring
storage-volume-health — Volume degraded, Volume faulted Warning, Critical En volym har varit försämrad — återuppbygger en replik — under hela de senaste 15 minuterna, eller trasig — ingen frisk replik, kan inte kopplas — under de senaste 2 minuterna

Ett volymlarm anger resursgruppen och anspråket som volymen ligger bakom när plattformen kan avgöra det, i beskrivningen och i metadata (resourceGroup, resourceName).

Själva övervakningen

Regel Nivå Slår till när
scrape-target-stale — Monitoring target stale Critical Longhorns mätvärdesslutpunkter är kända men inga lagringsmätvärden har kommit in på över 10 minuter. Varje lagringslarm är blint medan det är aktivt

Utlösta av andra plattformskomponenter

En plattformskomponent kan utlösa och avsluta ett eget larm via övervakningsmodulen; den behöver monitoring/platform/alerts/write, som tjänsterollen Platform Alert Publisher har. Platform Owner och Platform Contributor har den också, så de kan utlösa och lösa sådana larm via samma API — se Behörigheter. Plattformens säkerhetskopior utlöser till exempel ett medan misslyckad arkivering av plattformsdatabasens transaktionslogg (WAL) fyller dess volym. De här larmen har kategorin Platform och öppnas och löses när komponenten säger det.

Varje gång ett av dem öppnas, byter nivå eller löses skriver övervakningsmodulen det också till sin logg som en post med namnet stackship.alert, på larmets nivå och aldrig under Warning. Med export av telemetri påslagen lämnar posten klustret tillsammans med plattformens övriga loggar, om inte exportens lägsta loggnivå ligger över den — se Exportera plattformens telemetri. Reglerna på den här sidan och resursreglerna skrivs inte på det här sättet.

Larmmejl

En gång i minuten, när reglerna har körts, försöker övervakningsmodulen mejla en sammanställning av larmen som öppnats på nivån Critical eller lösts medan de låg på Critical. Den omfattar modulens egna regler, resursreglerna medräknade, men inte larm som andra komponenter utlöst; ett larm som öppnas på en lägre nivå och senare stiger till Critical meddelas inte när det stiger. Sammanställningen går till varje användare som direkt tilldelats Platform Owner eller Platform Contributor på roten — medlemmar i en grupp som har rollen räknas inte — eller, när det inte finns någon sådan användare, till adresserna i Alerts__Notifications__FallbackAddresses.

Viktigt

Inget larmmejl levereras i den här versionen. Sammanställningen använder e-postmallen platform-alert-digest, som inte finns bland mallarna som plattformen levereras med, så plattformen avvisar varje meddelande och modulen loggar Could not enqueue an alert digest för varje mottagare. Håll i stället koll på sidan Hälsa och resursernas Larm.

Om Alerts__Notifications__Enabled sätts till false på övervakningsmodulen upphör försöken — se Inställningar.