Gå til indhold
atlas

Forveksl ikke disse

Latens vs. Gennemløb (throughput)

Hvorfor de er forskellige

Latens er, hvor længe én forespørgsel venter; gennemløb er, hvor meget arbejde der i alt klares pr. sekund. At samle forespørgsler i grupper hæver ofte gennemløbet, men får hver enkelt til at vente længere.

Latens

AI-hardware og drift

Hvor længe én forespørgsel skal vente, fra den sendes, til svaret kommer - for en AI-chat pausen før og mens den svarer.

Formelt

Tiden fra en forespørgsel forlader afsenderen, til det tilhørende svar er modtaget, typisk angivet som en normal værdi og en værdi for de langsomme, fx den tid, 99 ud af 100 forespørgsler er hurtigere end; for en sprogmodel dækker den kø, læsning af prompten og frembringelse af hvert token.

Forklaret enkelt

Som ventetiden fra man bestiller en kaffe, til man står med den i hånden - den siger intet om, hvor mange kaffer caféen laver i timen.

I praksis

Den webansvarlige i en boligforening flytter lejerchatten over på en mindre model, fordi lejerne gav op, når svarene var otte sekunder om at begynde; den mindre model begynder at svare på under ét.

Hvorfor det betyder noget

Folk bedømmer en tjeneste på, hvor hurtigt den svarer, og værktøjer, der kalder en model mange gange i træk, mærker hver ekstra forsinkelse lægge sig oven i hinanden.

Gennemløb (throughput)

AI-hardware og drift

Hvor meget arbejde et system i alt når igennem per sekund - for AI-tjenester ofte talt som tokens eller forespørgsler håndteret i sekundet.

Formelt

Den hastighed, hvormed et system fuldfører arbejde, målt som færdige enheder per tidsenhed, fx forespørgsler per sekund; for en sprogmodeltjeneste er det normalt det samlede antal tokens, der frembringes per sekund på tværs af alle brugere på én gang.

Forklaret enkelt

Som at tælle, hvor mange biler der krydser en bro i timen - en bredere bro lukker flere igennem, selv om hver bil ikke kører hurtigere.

I praksis

En driftsingeniør i et dansk softwarehus, der driver et chatværktøj for 30 kommuner, måler, at GPU-serveren i alt producerer 2.500 tokens i sekundet - nok til omkring 100 samtidige brugere - og bestiller en server mere før spidsbelastningen mandag morgen.

Hvorfor det betyder noget

Det afgør, hvor mange maskiner en tjeneste har brug for, og hvad hvert svar koster, så det styrer den pris, brugerne betaler, og hvordan tjenesten klarer pludselige stormløb.

Fælles forbindelser

Atlas er i beta.