Gå til indhold
atlas

Computerbrug (computer use)

Også kendt som: computerbrugende agent

At lade en AI-agent betjene en computer, som et menneske gør - den ser på billeder af skærmen, flytter musen og skriver.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En form for værktøjskald, hvor værktøjerne er skærm, mus og tastatur; en multimodal model får billeder af skærmen og svarer med handlinger som "klik her" eller "skriv denne tekst" og gentager, til opgaven er løst.

Forklaret enkelt

Som en afløser, der sidder ved dit skrivebord, mens du er væk - vedkommende ser den samme skærm, trykker på de samme knapper og kan gøre alt, hvad du kunne fra den stol.

I praksis

En bogholder i et rederi lader en agent kopiere fragtbeløb fra et gammelt bookingprogram uden API over i økonomisystemet; den åbner hver booking, aflæser tallene på skærmen og taster dem ind.

Hvorfor det betyder noget

Det når ethvert program, et menneske kan bruge, også uden API, men alt, der vises på skærmen - en webside, et pop op-vindue - kan bære skjulte ordrer, og hvert klik er en rigtig handling.

Teknisk uddybning

Anthropic udgav computer use som offentlig beta den 22. oktober 2024 med en opgraderet Claude 3.5 Sonnet, og OpenAI fulgte i januar 2025 med Operator og modellen Computer-Using Agent; andre laboratorier og browserleverandører har siden lanceret tilsvarende funktioner. Mekanisk er det almindelige værktøjskald med en særlig værktøjsdefinition. Klienten erklærer et computerværktøj med skærmens dimensioner; modellen returnerer tool use-blokke med handlinger som screenshot, left_click ved (x, y), left_click_drag, scroll, type, key (en tastekombination) eller wait; klienten udfører dem mod en rigtig eller virtuel skærm og returnerer resultatet, for observerende handlinger et nyt skærmbillede. Løkken gentages, indtil modellen holder op med at bede om værktøjer.

Koordinater angives i pixelrummet for det skærmbillede, modellen så, og det giver en klassisk fejl. Vision-API'er nedskalerer store billeder (Anthropics grænse er ca. 1568 px på den lange led og omkring 1,15 megapixel), så en klient, der sender et 4K-skærmbillede og klikker på de returnerede koordinater uden omregning, rammer ved siden af. Implementeringer kører enten den virtuelle skærm i en moderat opløsning som 1280×800, som leverandørerne anbefaler, eller skalerer skærmbilleder ned og koordinater op igen. Nyere værktøjsversioner lader modellen samle flere handlinger pr. tur; klienten bør udføre dem i rækkefølge og stoppe ved første fejl, og afsluttes en samling med et skærmbillede, kan modellen verificere udfaldet i stedet for at antage det.

Pixelbaseret styring er den mest generelle tilgang og når gamle tykke klienter, Citrix-sessioner og alt uden API, men den er langsom, bruger mange tokens og er skrøbelig sammenlignet med alternativerne. Browseragenter, der læser DOM'en eller tilgængelighedstræet, og klassisk robotic process automation med deterministiske selektorer er hurtigere og mere gentagelige, når de kan bruges. Benchmarks som OSWorld (369 opgaver på tværs af rigtige desktopprogrammer, hvor mennesker lykkes i omkring 72 % af tilfældene) og WebArena følger udviklingen; typiske fejl er at fejllæse lille tekst, handle før en side er indlæst, miste overblikket over tilstanden over mange trin og klikke på det forkerte, visuelt lignende element.

Sikkerhedsbilledet følger af, at skærmen er upålideligt input, og at hvert klik er en rigtig handling. Enhver webside, e-mail eller ethvert dokument, der vises på skærmen, kan bære indirekte prompt injection, og agenten arver de sessioner og legitimationsoplysninger, maskinen har. Leverandørernes vejledning er samstemmende: Kør agenten i en dedikeret VM eller container med minimale rettigheder, undgå at eksponere indloggede konti eller hemmeligheder, begræns udgående netværkstrafik til en tilladelsesliste, og kræv menneskelig bekræftelse af handlinger med konsekvenser som køb, afsendelse af beskeder eller accept af vilkår. Anthropic kører desuden klassifikatorer over skærmbilleder for at markere sandsynlige injektionsforsøg, hvilket mindsker, men ikke fjerner risikoen.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Neuralt netværk
  2. →Token
  3. →Embedding
  4. →Transformer
  5. →Attention-mekanisme
  6. →Stor sprogmodel (LLM)
  7. →Encoder
  8. →Prompt
  9. →AI-agent
  10. →Multimodal model
  11. →Computerbrug (computer use)

Relationer

Kilder og videre læsning

Officiel dokumentation

  • Anthropic documentation - Computer use tool · Anthropic

Opslagsværker

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.