{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/computer-use","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/computer-use/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/computer-use/"},"term":{"en":"Computer use","da":"Computerbrug (computer use)"},"aka":{"en":["computer-using agent"],"da":["computerbrugende agent"]},"domain":["ai"],"cluster":"agents","layer":"agent","status":"emerging","era":2024,"summary":{"en":"Letting an AI agent work a computer like a person does - it looks at pictures of the screen and moves the mouse and types.","da":"At lade en AI-agent betjene en computer, som et menneske gør - den ser på billeder af skærmen, flytter musen og skriver."},"body":{"formal":{"en":"A form of tool calling in which the tools are the screen, mouse and keyboard; a multimodal model is sent pictures of the screen and answers with actions such as \"click at this point\" or \"type this text\", repeating until the task is done.","da":"En form for værktøjskald, hvor værktøjerne er skærm, mus og tastatur; en multimodal model får billeder af skærmen og svarer med handlinger som \"klik her\" eller \"skriv denne tekst\" og gentager, til opgaven er løst."},"plain":{"en":"Like a stand-in sitting at your desk while you are away - they see the same screen, press the same buttons, and can do anything you could do from that chair.","da":"Som en afløser, der sidder ved dit skrivebord, mens du er væk - vedkommende ser den samme skærm, trykker på de samme knapper og kan gøre alt, hvad du kunne fra den stol."},"inPractice":{"en":"A finance clerk at a shipping company has an agent copy freight totals from an old booking program with no API into the finance system; it opens each booking, reads the figures off the screen and types them in.","da":"En bogholder i et rederi lader en agent kopiere fragtbeløb fra et gammelt bookingprogram uden API over i økonomisystemet; den åbner hver booking, aflæser tallene på skærmen og taster dem ind."},"whyItMatters":{"en":"It reaches any program a person can use, even without an API, but anything shown on screen - a web page, a pop-up - can carry hidden orders, and every click is a real action.","da":"Det når ethvert program, et menneske kan bruge, også uden API, men alt, der vises på skærmen - en webside, et pop op-vindue - kan bære skjulte ordrer, og hvert klik er en rigtig handling."}},"deepDive":{"en":"Anthropic released computer use as a public beta on 22 October 2024 with an upgraded Claude 3.5 Sonnet, and OpenAI followed in January 2025 with Operator and its Computer-Using Agent model; other labs and browser vendors have since shipped comparable features. Mechanically it is ordinary tool calling with a special tool definition. The client declares a computer tool with the display dimensions; the model returns tool-use blocks naming actions such as screenshot, left_click at (x, y), left_click_drag, scroll, type, key (a key combination) or wait; the client executes them against a real or virtual display and returns the result, a fresh screenshot for observation actions. The loop repeats until the model stops requesting tools.\n\nCoordinates are expressed in the pixel space of the screenshot the model saw, which creates a classic bug. Vision APIs downscale large images (Anthropic's limit is roughly 1568 px on the long edge and about 1.15 megapixels), so a client that sends a 4K screenshot and clicks the returned coordinates unscaled will miss. Implementations either run the virtual display at a modest resolution such as 1280×800, which vendors recommend, or rescale screenshots down and coordinates back up. Recent tool versions let the model batch several actions per turn; the client should execute them in order and halt at the first failure, and ending a batch with a screenshot lets the model verify the outcome instead of assuming it.\n\nPixel-based control is the most general approach, reaching legacy thick clients, Citrix sessions and anything without an API, but it is slow, token-hungry and brittle compared with alternatives. Browser agents that read the DOM or accessibility tree, and classical robotic process automation with deterministic selectors, are faster and more repeatable when they apply. Benchmarks such as OSWorld (369 tasks across real desktop applications, with human success around 72%) and WebArena track progress; typical failures are misreading small text, acting before a page has loaded, losing track of state across many steps and clicking the visually similar wrong element.\n\nThe security posture follows from the fact that the screen is untrusted input and every click is a real action. Any web page, email or document rendered on screen can carry indirect prompt injection, and the agent inherits whatever sessions and credentials the machine holds. Vendor guidance is consistent: run the agent in a dedicated VM or container with minimal privileges, avoid exposing logged-in accounts or secrets, restrict network egress to an allowlist, and require human confirmation for consequential actions such as purchases, sending messages or accepting terms. Anthropic additionally runs classifiers over screenshots to flag likely injection attempts, which lowers but does not remove the risk.","da":"Anthropic udgav computer use som offentlig beta den 22. oktober 2024 med en opgraderet Claude 3.5 Sonnet, og OpenAI fulgte i januar 2025 med Operator og modellen Computer-Using Agent; andre laboratorier og browserleverandører har siden lanceret tilsvarende funktioner. Mekanisk er det almindelige værktøjskald med en særlig værktøjsdefinition. Klienten erklærer et computerværktøj med skærmens dimensioner; modellen returnerer tool use-blokke med handlinger som screenshot, left_click ved (x, y), left_click_drag, scroll, type, key (en tastekombination) eller wait; klienten udfører dem mod en rigtig eller virtuel skærm og returnerer resultatet, for observerende handlinger et nyt skærmbillede. Løkken gentages, indtil modellen holder op med at bede om værktøjer.\n\nKoordinater angives i pixelrummet for det skærmbillede, modellen så, og det giver en klassisk fejl. Vision-API'er nedskalerer store billeder (Anthropics grænse er ca. 1568 px på den lange led og omkring 1,15 megapixel), så en klient, der sender et 4K-skærmbillede og klikker på de returnerede koordinater uden omregning, rammer ved siden af. Implementeringer kører enten den virtuelle skærm i en moderat opløsning som 1280×800, som leverandørerne anbefaler, eller skalerer skærmbilleder ned og koordinater op igen. Nyere værktøjsversioner lader modellen samle flere handlinger pr. tur; klienten bør udføre dem i rækkefølge og stoppe ved første fejl, og afsluttes en samling med et skærmbillede, kan modellen verificere udfaldet i stedet for at antage det.\n\nPixelbaseret styring er den mest generelle tilgang og når gamle tykke klienter, Citrix-sessioner og alt uden API, men den er langsom, bruger mange tokens og er skrøbelig sammenlignet med alternativerne. Browseragenter, der læser DOM'en eller tilgængelighedstræet, og klassisk robotic process automation med deterministiske selektorer er hurtigere og mere gentagelige, når de kan bruges. Benchmarks som OSWorld (369 opgaver på tværs af rigtige desktopprogrammer, hvor mennesker lykkes i omkring 72 % af tilfældene) og WebArena følger udviklingen; typiske fejl er at fejllæse lille tekst, handle før en side er indlæst, miste overblikket over tilstanden over mange trin og klikke på det forkerte, visuelt lignende element.\n\nSikkerhedsbilledet følger af, at skærmen er upålideligt input, og at hvert klik er en rigtig handling. Enhver webside, e-mail eller ethvert dokument, der vises på skærmen, kan bære indirekte prompt injection, og agenten arver de sessioner og legitimationsoplysninger, maskinen har. Leverandørernes vejledning er samstemmende: Kør agenten i en dedikeret VM eller container med minimale rettigheder, undgå at eksponere indloggede konti eller hemmeligheder, begræns udgående netværkstrafik til en tilladelsesliste, og kræv menneskelig bekræftelse af handlinger med konsekvenser som køb, afsendelse af beskeder eller accept af vilkår. Anthropic kører desuden klassifikatorer over skærmbilleder for at markere sandsynlige injektionsforsøg, hvilket mindsker, men ikke fjerner risikoen."},"edges":[{"type":"requires","to":"ai/ai-agent","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/multimodal-model","why":{"en":"The model must read pictures of the screen to know where things are before it can decide what to click.","da":"Modellen skal kunne læse billeder af skærmen for at vide, hvor tingene er, før den kan beslutte, hvad den skal klikke på."},"confidence":"high","strength":"primary"},{"type":"kind-of","to":"ai/tool-calling","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/human-in-the-loop","why":{"en":"Computer-use agents usually stop and ask a person before steps like buying, sending or logging in.","da":"Computerbrugende agenter stopper typisk og spørger en person før trin som at købe, sende eller logge ind."},"confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/prompt-injection","why":{"en":"Text on a web page or in a document on screen is read by the model and can steer what it does next.","da":"Tekst på en webside eller i et dokument på skærmen læses af modellen og kan styre, hvad den gør bagefter."},"confidence":"high","strength":"primary"}],"depth":5,"sources":[{"title":"Anthropic documentation - Computer use tool","tier":"official-doc","publisher":"Anthropic"},{"title":"Anthropic (2024), Introducing computer use","tier":"reference","publisher":"Anthropic"},{"title":"Xie et al. (2024), OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","url":"https://arxiv.org/abs/2404.07972","tier":"reference","publisher":"arXiv"}],"draft":true}