Felsök övervakningen
Ta reda på varför diagrammen är tomma för alla resurser, varför HTTP-diagrammen inte ser några förfrågningar, varför lagringssiffror saknas eller är fel, och varför övervakningstabellerna fortsätter att växa.
Kräver: monitoring/platform/read
Kontrollerna nedan använder sidan Hälsa, som kräver monitoring/platform/read på roten, och
kubectl mot plattformens eget kluster. Vad varje källa ger beskrivs i
Vad övervakningen behöver från klustret.
Ingen resurs har mätvärden
Kontrollera på Hälsa → Karta att Monitoring, under Moduler, är frisk, eller kör:
kubectl -n stackship-system get deployment module-monitoringLäs dess logg:
kubectl -n stackship-system logs deployment/module-monitoring --since=15mMeddelande Betyder Scrape failed for …; backing offEn källa kunde inte läsas; meddelandet anger vilken. Den försöks igen efter högst 2 minuter Pod informer watch disconnected; reconnecting in 5sModulen har tappat sin bevakning av klustrets poddar. Tills den har återanslutit läggs nya poddar inte under sina resurser Failed to attribute pod …; skippingEn podd kunde inte läggas under sin resurs; de andra påverkas inte Om Hälsa → Noder visar CPU använt och Minne använt för noderna läses kubelets, och avläsningarna läggs inte under resurserna. Leta efter
Failed to attribute podi loggen, och kontrollera att resursens poddar körs i ett namnområde vars namn börjar medrg-och har etiketternaplatform.stackship.se/nameochplatform.stackship.se/boundary. En podd utanplatform.stackship.se/typeläggs under en app, så varje annan resurs behöver också den etiketten.
HTTP-diagrammen säger att inga förfrågningar observerats
Att varje HTTP-diagram visar Inga förfrågningar under perioden, på resurser som faktiskt får trafik, betyder att modulen inte har hittat ingresskontrollerns mätvärden.
kubectl get endpoints -A | grep -E 'ingress-nginx-controller|traefik-metrics'- Inget listas. Med nginx: hitta kontrollerns Service och sätt
IngressController__ServiceNametill dess namn. Med Traefik: lägg till en Service med namnettraefik-metricsför Traefiks mätvärdesport 9100. - Listas utan adresser. Tjänsten väljer inga körande poddar.
Starta sedan om modulen — se Inställningar.
Ingen lagring på Hälsa
Kortet Lagring visar Ingen lagringsleverantör rapporterar mätvärden i det här klustret. när
modulen inte hittar någon Longhorn. Det är väntat i ett kluster med en annan lagringsdrivrutin. Med
Longhorn, kontrollera att dess Service finns och stämmer med Longhorn__ServiceName:
kubectl -n longhorn-system get endpoints longhorn-backendEtt larm Monitoring target stale betyder att modulen hittar Longhorn men inte får några mätvärden från den.
Lagring reserverat ser fel ut
Om Lagring reserverat ligger långt från vad Longhorn själv rapporterar — till exempel över 100 %
på noder där volymer fortfarande schemaläggs — jämför modulens procentsats för överallokering med
Longhorns, som i Longhorn. Sätt
Longhorn__OverProvisioningPercentage till Longhorns värde och starta om modulen; siffran och larmet
om schemaläggningsmarginal följer från och med då.
Övervakningstabellerna fortsätter att växa
Öppna Hälsa → Databas, som bara en Platform Owner ser. Ett jobb under Bakgrundsjobb som aldrig
har lyckats kan vara ett av modulens jobb för lagringstid, komprimering eller sammanräkning. Leta i
modulens logg efter Timescale policy statement did not apply, som anger en policy som den inte kunde
koppla på vid start. Lagring på samma flik visar hur stor varje databas har blivit. Hur länge varje
tabell ska behålla sin data står i Lagring och lagringstid för mätvärden.