ChatGPT, superstjernen inden for kunstig intelligens, er blevet stillet over for et spørgsmål, mens det fortsætter med at bevæge sig fremad: Har det opfyldt Turing-teststandarden til at generere output, der ikke kan skelnes fra menneskelige reaktioner? Den seneste forskning tyder på, at ChatGPT, på trods af dens fremragende ydeevne, ikke ser ud til at have krydset den tærskel fuldt ud.
To forskere ved University of California, San Diego, Cameron Jones, ekspert i sprog, semantik og maskinlæring, og Benjamin Bergen, professor i kognitiv videnskab, stillede dette spørgsmål ved at henvise til Turings arbejde for 70 år siden. Turing foreslog en proces til at afgøre, om en maskine kunne opnå et niveau af intelligens og samtaleevne, der var tilstrækkeligt til at narre andre til at tro, at den var menneskelig.
Deres rapport har titlen "Består GPT-4 Turing-testen?" Den kan findes på arXiv preprint-serveren. Til undersøgelsen samlede de 650 deltagere til at spille 1.400 "spil", hvor deltagerne havde en kort samtale med et andet menneske eller GPT-model og blev bedt om at bestemme, hvem de talte med.
Det, forskerne fandt, var bemærkelsesværdigt. GPT-4-modellen narre deltagerne 41 procent af tiden, mens GPT-3.5 kun narre dem 5 til 14 procent af tiden. Interessant nok lykkedes det kun for mennesker at overbevise deltagerne om, at de ikke var maskiner i 63 procent af forsøgene.
"Vi fandt ingen beviser for, at GPT-4 bestod Turing-testen," konkluderede forskerne. De bemærker dog, at Turing-testen stadig har værdi i vurderingen af virkningerne af maskinsamtaler, som en ramme til at måle glatte sociale interaktioner og bedrag, og til at forstå menneskelige strategier for tilpasning til disse enheder.
De advarer dog også om, at chatbots i mange tilfælde stadig vil være i stand til at kommunikere på en overbevisende måde. "Den 41 procent succesrate tyder på, at AI-modeller allerede kan have evnen til at bedrage, især i situationer, hvor mennesker er mindre opmærksomme på muligheden for, at de måske ikke taler til et menneske," bemærker forskerne. AI-modeller, der robust efterligner mennesker, kan have brede sociale og økonomiske implikationer."
Forskerne observerede, at deltagere, der korrekt identificerede AI med mennesker, fokuserede på flere faktorer. En model, der er for formel eller for uformel, vækker mistanke. Hvis deres udtryk er for ordrigt eller for kortfattet, hvis deres grammatik eller tegnsætning er usædvanligt god eller "ikke overbevisende" dårlig, vil det også være en nøglefaktor for at afgøre, om deltagerne interagerer med mennesker eller maskiner. Derudover var deltagerne følsomme over for svar, der lød for generiske.
Forskerne foreslår, at sporing af AI-modeller bliver stadig vigtigere, efterhånden som de bliver mere flydende og absorberer flere menneskelignende særheder. "At identificere faktorer, der fører til bedrag og strategier til at afbøde det, vil blive stadig vigtigere," sagde de. Undersøgelsen afslører, at området for intelligent samtale stadig står over for udfordringer, men giver også nyttig indsigt i, hvordan AI-modeller kan forbedres.
