Den 1 april publicerade ett forskarlag från MIT en studie över hur väl AI klarar av att utföra uppgifter i många olika yrken. Studien visar att längden på uppgifterna som AI klarar av att genomföra, mätt i hur lång tid de tar för mänskliga experter, dubblas var fjärde månad.
Konkret: I början av 2024 klarade de bästa AI-modellerna av att genomföra 60 procent av de uppgifter som tog mänskliga experter drygt en timme. Ett och ett halvt år senare hanterade de 60 procent av uppgifter som tog experter 24 timmar. Liknande dubbleringstid konstaterades med hårdare och mildare krav (från 50 till 80 procent godkända uppgifter).
MIT-studiens resultat stämmer med en välkänd studie som endast fokuserade på uppgifter inom mjukvaruutveckling, och använde mer kontrollerade metoder.
Även om längden på uppgifter som AI kan hantera med given framgång ökar snabbt, visade MIT-studien att graden av framgång på uppgifter med en viss längd ökar långsammare. Andelen uppgifter som AI inte lyckas lösa halveras ungefär vart tredje år; snabbare för enklare uppgifter, långsammare för längre uppgifter.
I kombination pekar studiens resultat i praktiken mot följande:
Det går att hitta uppgifter som AI kan genomföra med godkänt resultat, även bland sådant som tar mänskliga experter mycket lång tid.
Andelen uppgifter som AI kan göra av en given längd, och tillförlitligheten i resultatet, ökar i termer av år – inte månader.
MIT-studien är särskilt intressant eftersom mjukvaruutveckling genomgår en stor omvandling på grund av AI. Resultaten pekar mot att annat kunskapsarbete är på väg mot samma omvandling, men fördröjt.
Några detaljer om metoder i studien:
Uppgifterna valdes ut från databasen O*NET (Occupational Information Network), från USA:s arbetsmarknadsdepartementet.
En uppgift räknades som godkänd om experter bedömde att resultatet skulle godkännas av en chef utan justeringar.
Längden på uppgifter avgjordes genom uppskattningar, inte genom att låta mänskliga experter genomföra uppgifterna.
Svaren från AI-modellerna begränsades till 700 ord. De testades sannolikt endast i form av chattbottar, inte genom agentiska ramverk. Båda dessa faktorer underdriver sannolikt hur AI hanterar uppgifter jämfört med verklig användning.
Artikeln är i pre-print och ännu inte granskad. Finansiering kommer från Open Philanthropy (nu Coefficient Giving) och ett ej namngivet teknikföretag.
Fler länkar:
AI-bevakning sammanfattar de viktigaste AI-nyheterna på svenska, som underlag för journalister, beslutsfattare och andra som vill följa utvecklingen. Läs mer här.
Inga inlägg

Comments
Nothing yet. Say the first thing.
Sign in to join the conversation.