Övervakning
Vad plattformen mäter hos dina resurser, var du ser det och hur larm talar om att något behöver åtgärdas.
Plattformen mäter resurserna den kör — CPU, minne, nätverkstrafik, diskanvändning och HTTP-förfrågningar — och sparar historiken. En gång i minuten kontrollerar den mätningarna och tillståndet hos varje resurs poddar mot en uppsättning inbyggda regler, och utlöser ett larm när någon av dem hittar ett problem. Det finns inget att ställa in: en resurs mäts från det ögonblick dess poddar kör.
Var du ser det
| Var | Vad |
|---|---|
| En resurs Översikt, kortet Mätvärden | Diagram över resursens användning och trafik, från de senaste 15 minuterna upp till de senaste 7 dagarna — se Läs en resurs mätvärden |
| En resurs Översikt, kortet Aktiva larm | Resursens larm som är aktiva just nu. Kortet finns bara där medan något är det |
| En resurs flik Larm | Resursens larm, aktiva och lösta. Fliken dyker upp när resursen har utlöst ett larm — se Visa larm |
stsh monitor alerts |
Larmen som är aktiva just nu i en hel boundary |
| Hälsa i sidomenyn | För plattformsadministratörer: plattformens komponenter, nodernas kapacitet och larmen om själva plattformen — se Sidan Hälsa |
Vad som mäts
Var 15:e sekund läser plattformen containerstatistiken från varje nod, fyllnadsgraden för varje persistent volym och ingresskontrollerns räknare för förfrågningar, och lägger varje avläsning under den resurs den hör till. Vad en resurs får beror på vad den har:
- varje resurs med poddar får CPU, minne och nätverkstrafik;
- en resurs med en persistent volym får även diskanvändning;
- en resurs som nås via plattformens ingress får även HTTP-förfrågningar per statusklass.
Hur siffrorna samlas in, och hur länge de sparas, beskrivs i Mätvärden; vilka diagram varje resurstyp visar i Diagram och mätvärden.
Vad larmen täcker
De inbyggda reglerna letar efter en container som ligger nära sin CPU- eller minnesgräns eller hålls tillbaka av sin CPU-gräns, containrar som kraschar, startas om eller stoppas för att de fått slut på minne, avbilder som inte kan hämtas, poddar som inte är redo eller inte kan schemaläggas, en växande andel HTTP-serverfel, och resurser som inte har driftsatts om på 90 dagar. Ett larm löses av sig självt när regeln inte längre hittar problemet. Se Larm och Larmregler.
Vad övervakningen inte gör
- Den meddelar dig inte. Larm visas i portalen och listas av CLI:t och API:t; plattformen skickar inget e-postmeddelande, ingen webhook och inget annat meddelande till en resurs användare när ett larm utlöses. E-postsammanställningen som den försöker skicka till plattformens administratörer levereras inte i den här versionen — se Aviseringar.
- Den har inga egna regler. Reglerna och deras tröskelvärden är inbyggda och desamma för alla resurser.
- Den samlar inte in din applikations egna mätvärden eller loggar. Den läser vad klustret rapporterar om dina containrar, inte en slutpunkt som din applikation exponerar. Loggar finns på varje resurs egen sida — för en app, se Loggar.
- Den mäter plattformens eget kluster. En resurs som kör i ett annat kluster anslutet till plattformen har inga mätvärden och utlöser inga larm.
Säkerhets- och driftanalys av dina resurser är en separat funktion i plattformen, Sentinel.
Sidor
- Mätvärden — hur siffrorna samlas in och sparas
- Läs en resurs mätvärden
- Diagram och mätvärden
- Larm — hur ett larm öppnas, ändras och löses
- Visa larm
- Larmregler
- Behörigheter