Gå til indhold
atlas

Overvågning (monitoring)

Også kendt som: monitorering

At holde øje med en række udvalgte målinger på systemer over tid og advare folk, når en af dem bevæger sig uden for det normale.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Løbende indsamling af kendte mål for et systems sundhed, fx om det svarer, hvor meget det har at lave, og hvor ofte det fejler, som vises og holdes op mod faste grænser, så kendte typer af problemer udløser en alarm.

Forklaret enkelt

Som advarselslamperne på en bils instrumentbræt; de fortæller hurtigt, at olien er lav, men ikke hvorfor motoren laver en underlig lyd.

I praksis

En skærm i vandværkets kontrolrum viser hukommelsesforbrug, svartider og antal fejl for de servere, der styrer pumpestationerne, og bliver rød, når en af dem holder op med at svare.

Hvorfor det betyder noget

Den holder tjenester tilgængelige ved at fange kendte problemer, før brugerne mærker dem, og det er ofte her, et angreb først viser sig som usædvanlig belastning eller fejl.

Teknisk uddybning

Googles SRE-bog beskriver overvågning som indsamling, behandling, aggregering og visning af kvantitative realtidsdata om et system og trækker en vigtig skillelinje mellem black-box- og white-box-overvågning. Black-box-overvågning tester den udefra synlige adfærd, som en bruger ville opleve den, med syntetiske HTTP-forespørgsler, DNS-opslag eller scriptede login-forløb fra flere lokationer; den opdager symptomer, der sker nu, men siger intet om årsager eller forestående fejl. White-box-overvågning bygger på indre data, som systemet selv udstiller (metrik-endpoints, logs, runtime-statistik), og kan afsløre en kø, der fyldes op, eller genforsøg, der skjuler fejl, før brugerne rammes. Real user monitoring, der indsamler tidsmålinger fra rigtige browsere eller apps, supplerer begge.

Arkitektonisk har overvågning udviklet sig fra tjekbaserede systemer til tidsseriesystemer. Nagios (udgivet i 1999 som NetSaint) og dets efterfølgere kører plugins, der returnerer OK, WARNING, CRITICAL eller UNKNOWN pr. host og tjeneste, mens SNMP-polling og traps stadig er udbredt til netværksudstyr og appliances. Prometheus, der blev startet hos SoundCloud i 2012 og optaget i CNCF i 2016 som projekt nummer to efter Kubernetes, gjorde det udbredt at hente metrikker med labels ind i en tidsseriedatabase og udtrykke både dashboards og alarmbetingelser som forespørgsler mod den, mens service discovery holder listen over targets i takt med en dynamisk infrastruktur. Dashboards (typisk med Grafana som frontend) er til mennesker; alarmregler er til maskiner, og de to bør ikke forveksles.

Hyppige fejl er at overvåge selve overvågningssystemet inde fra samme fejldomæne, så et netværks- eller klyngenedbrud tager både tjenesten og det system, der skulle rapportere om den; forældede targets efter ændringer i infrastrukturen, som lydløst holder op med at levere data; tærskler kopieret fra standardværdier i stedet for udledt af brugerpåvirkning; og dashboards med hundredvis af paneler, som ingen kan tolke under en hændelse. Et meta-overvågningstjek fra en uafhængig lokation og en watchdog-alarm, der altid fyrer, adresserer de to første.

Overvågning har også en compliance-rolle. ISO/IEC 27001:2022 Annex A kontrol 8.16, Monitoring activities, forventer, at netværk, systemer og applikationer overvåges for unormal adfærd, og sikkerhedsteams bruger typisk den samme telemetri via et SIEM. Sammenlignet med observerbarhed er overvågning den snævrere praksis at holde øje med foruddefinerede signaler for kendte fejltyper; observerbarhed er den egenskab ved systemet, der gør det muligt at stille nye spørgsmål under uventede hændelser. I praksis deler de to pipelines, og modne teams bruger fortsat overvågning til alarmering og højdimensionelle data til undersøgelse.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Metrikker
  2. →Overvågning (monitoring)

Relationer

Forudsætter
Metrikker
Forveksl ikke med
Observerbarhed

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.