Tid til første token (TTFT)
Også kendt som: TTFT
Hvor længe en bruger venter, efter at have sendt en prompt, før den første del af svaret dukker op på skærmen.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Latensen fra en forespørgsel når frem til en sprogmodeltjeneste, til det første token i svaret sendes tilbage; den består mest af ventetid i kø og læsning af hele prompten og vokser med promptens længde.
Forklaret enkelt
Som pausen efter du har stillet nogen et spørgsmål, og før de siger deres første ord - en lang pause føles langsom, selv om de derefter taler hurtigt.
I praksis
En produktejer i en kommune tester en stemmeassistent til borgertelefonen; borgerne lægger på, når tavsheden, efter at de har talt, varer mere end cirka et sekund, så hun følger tiden til første token på hvert testopkald.
Hvorfor det betyder noget
Fordi svar strømmer ind ord for ord, er denne første ventetid det, folk mærker mest, og derfor er det det hastighedstal, chatprodukter holder nøjest øje med.
Teknisk uddybning
TTFT er summen af flere trin: netværkstid fra klient til server, overhead i autentificering og gateway, tokenisering, ventetid i kø, indtil scheduleren optager forespørgslen, prefill-gennemløbet over hele prompten, sampling af det første token og returrejsen for den første streamede bid. Kun ét af disse trin vokser direkte med model- og promptstørrelse. Prefill koster cirka 2 × antal parametre × antal prompt-tokens i FLOPs for de tætte lag plus et attention-led, der vokser kvadratisk med promptlængden, og da prefill er compute-bound, har det gavn af acceleratorens rå FLOPS frem for hukommelsesbåndbredde. En prompt på 100.000 tokens kan derfor tage sekunder at prefille selv på hurtig hardware, mens en kort chatbesked domineres af kø- og netværkstid.
TTFT skal holdes adskilt fra de mål, der beskriver resten af svaret. Tid pr. output-token (TPOT) er det gennemsnitlige interval mellem efterfølgende tokens; inter-token-latens (ITL) er fordelingen af disse intervaller, hvor spidser afslører hak i planlægningen; end-to-end-latens dækker hele svaret. Et system kan have fremragende TTFT og dårlig TPOT eller omvendt, og de reagerer på forskellige optimeringer. Hvor TTFT måles, betyder også noget: målinger på klientsiden omfatter netværk og TLS-opsætning, målinger på serversiden starter normalt, når forespørgslen modtages, og benchmarkværktøjer er uenige om, hvorvidt en første tom bid eller en bid, der kun angiver rollen, tæller som første token.
De vigtigste håndtag på TTFT er promptlængde, prefix eller prompt caching (prefill springes over for et gemt fælles præfiks), planlægningspolitik og ledig kapacitet. Serving-motorer står i et dilemma: en ny forespørgsels prefill konkurrerer med decode-trinnene for de forespørgsler, der allerede kører. Prioriteres prefill, forbedres TTFT, men brugere, der streamer, oplever stop; chunked prefill, som i Sarathi-Serve, deler lange prompter op i stykker, der flettes ind mellem decode-trinnene for at begrænse forstyrrelsen, og disaggregeret servering flytter prefill helt over på separate GPU'er. Tensorparallelisme over flere GPU'er forkorter også prefill for store modeller.
To nyere mønstre gør målet mere kompliceret. Ræsonnerende modeller kan bruge mange tokens på at tænke, før det synlige svar begynder; er tænkningen skjult eller opsummeret, oplever brugeren tiden til første synlige token, som kan være langt større end TTFT målt i API'et. Agenter, der bruger værktøjer, og retrieval-pipelines lægger søge- og værktøjslatens til, før modelkaldet overhovedet starter. I stemmegrænseflader, hvor en pause på omkring et sekund allerede føles unaturlig, budgetterer teams TTFT sammen med latensen i talegenkendelse og talesyntese og bruger ofte mindre modeller eller spekulative tidlige svar for at holde budgettet.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Token
- →Transformer
- →Stor sprogmodel (LLM)
- →Prompt
- →Tid til første token (TTFT)
Relationer
- En slags
- Latens
- Bruges sammen med
- Prompt cachingLille sprogmodel (SLM)Gennemløb (throughput)
Kilder og videre læsning
Officiel dokumentation
- NVIDIA NIM for LLMs documentation - benchmarking metrics (time to first token) · NVIDIA
Opslagsværker
- Kwon et al. (2023), Efficient Memory Management for Large Language Model Serving with PagedAttention
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…