Hoppa till innehållet
Stackship-dokumentation English

ÖvervakningAdministratörerMaskinöversatt

Felsök övervakningen

Ta reda på varför diagrammen är tomma för alla resurser, varför HTTP-diagrammen inte ser några förfrågningar, varför lagringssiffror saknas eller är fel, och varför övervakningstabellerna fortsätter att växa.

Kräver: monitoring/platform/read

Kontrollerna nedan använder sidan Hälsa, som kräver monitoring/platform/read på roten, och kubectl mot plattformens eget kluster. Vad varje källa ger beskrivs i Vad övervakningen behöver från klustret.

Ingen resurs har mätvärden

  1. Kontrollera på Hälsa → Karta att Monitoring, under Moduler, är frisk, eller kör:

    bash
    kubectl -n stackship-system get deployment module-monitoring
  2. Läs dess logg:

    bash
    kubectl -n stackship-system logs deployment/module-monitoring --since=15m
    Meddelande Betyder
    Scrape failed for …; backing off En källa kunde inte läsas; meddelandet anger vilken. Den försöks igen efter högst 2 minuter
    Pod informer watch disconnected; reconnecting in 5s Modulen har tappat sin bevakning av klustrets poddar. Tills den har återanslutit läggs nya poddar inte under sina resurser
    Failed to attribute pod …; skipping En podd kunde inte läggas under sin resurs; de andra påverkas inte
  3. Om Hälsa → Noder visar CPU använt och Minne använt för noderna läses kubelets, och avläsningarna läggs inte under resurserna. Leta efter Failed to attribute pod i loggen, och kontrollera att resursens poddar körs i ett namnområde vars namn börjar med rg- och har etiketterna platform.stackship.se/name och platform.stackship.se/boundary. En podd utan platform.stackship.se/type läggs under en app, så varje annan resurs behöver också den etiketten.

HTTP-diagrammen säger att inga förfrågningar observerats

Att varje HTTP-diagram visar Inga förfrågningar under perioden, på resurser som faktiskt får trafik, betyder att modulen inte har hittat ingresskontrollerns mätvärden.

bash
kubectl get endpoints -A | grep -E 'ingress-nginx-controller|traefik-metrics'
  • Inget listas. Med nginx: hitta kontrollerns Service och sätt IngressController__ServiceName till dess namn. Med Traefik: lägg till en Service med namnet traefik-metrics för Traefiks mätvärdesport 9100.
  • Listas utan adresser. Tjänsten väljer inga körande poddar.

Starta sedan om modulen — se Inställningar.

Ingen lagring på Hälsa

Kortet Lagring visar Ingen lagringsleverantör rapporterar mätvärden i det här klustret. när modulen inte hittar någon Longhorn. Det är väntat i ett kluster med en annan lagringsdrivrutin. Med Longhorn, kontrollera att dess Service finns och stämmer med Longhorn__ServiceName:

bash
kubectl -n longhorn-system get endpoints longhorn-backend

Ett larm Monitoring target stale betyder att modulen hittar Longhorn men inte får några mätvärden från den.

Lagring reserverat ser fel ut

Om Lagring reserverat ligger långt från vad Longhorn själv rapporterar — till exempel över 100 % på noder där volymer fortfarande schemaläggs — jämför modulens procentsats för överallokering med Longhorns, som i Longhorn. Sätt Longhorn__OverProvisioningPercentage till Longhorns värde och starta om modulen; siffran och larmet om schemaläggningsmarginal följer från och med då.

Övervakningstabellerna fortsätter att växa

Öppna Hälsa → Databas, som bara en Platform Owner ser. Ett jobb under Bakgrundsjobb som aldrig har lyckats kan vara ett av modulens jobb för lagringstid, komprimering eller sammanräkning. Leta i modulens logg efter Timescale policy statement did not apply, som anger en policy som den inte kunde koppla på vid start. Lagring på samma flik visar hur stor varje databas har blivit. Hur länge varje tabell ska behålla sin data står i Lagring och lagringstid för mätvärden.