AI-hardware og drift
Hvor længe én forespørgsel skal vente, fra den sendes, til svaret kommer - for en AI-chat pausen før og mens den svarer.
Formelt
Tiden fra en forespørgsel forlader afsenderen, til det tilhørende svar er modtaget, typisk angivet som en normal værdi og en værdi for de langsomme, fx den tid, 99 ud af 100 forespørgsler er hurtigere end; for en sprogmodel dækker den kø, læsning af prompten og frembringelse af hvert token.
Forklaret enkelt
Som ventetiden fra man bestiller en kaffe, til man står med den i hånden - den siger intet om, hvor mange kaffer caféen laver i timen.
I praksis
Den webansvarlige i en boligforening flytter lejerchatten over på en mindre model, fordi lejerne gav op, når svarene var otte sekunder om at begynde; den mindre model begynder at svare på under ét.
Hvorfor det betyder noget
Folk bedømmer en tjeneste på, hvor hurtigt den svarer, og værktøjer, der kalder en model mange gange i træk, mærker hver ekstra forsinkelse lægge sig oven i hinanden.