ChatGPT, superstjärnan inom artificiell intelligens, har ställts inför en fråga när den fortsätter att gå framåt: Har den uppfyllt Turing-teststandarden för att generera utdata som inte kan skiljas från mänskliga svar? Den senaste forskningen tyder på att ChatGPT, trots dess utmärkta prestanda, inte verkar ha passerat den tröskeln helt.
Två forskare vid University of California, San Diego, Cameron Jones, expert på språk, semantik och maskininlärning, och Benjamin Bergen, professor i kognitionsvetenskap, ställde denna fråga genom att referera till Turings arbete för 70 år sedan. Turing föreslog en process för att avgöra om en maskin kunde uppnå en nivå av intelligens och konversationsförmåga som var tillräcklig för att lura andra att tro att den var mänsklig.
Deras rapport har rubriken "Klar GPT-4 Turing-testet?" Den finns på arXiv preprint-server. För studien samlade de 650 deltagare för att spela 1 400 "spel" där deltagarna hade ett kort samtal med en annan människa eller GPT-modell och ombads att bestämma vem de pratade med.
Det som forskarna fann var anmärkningsvärt. GPT-4-modellen lurade deltagarna 41 procent av gångerna, medan GPT-3.5 bara lurade dem 5 till 14 procent av gångerna. Intressant nog lyckades människor bara övertyga deltagarna om att de inte var maskiner i 63 procent av försöken.
"Vi hittade inga bevis för att GPT-4 klarade Turing-testet", avslutade forskarna. De noterar dock att Turing-testet fortfarande har värde för att bedöma effekterna av maskinkonversationer, som ett ramverk för att mäta smidiga sociala interaktioner och bedrägeri, och för att förstå mänskliga strategier för att anpassa sig till dessa enheter.
Men de varnar också för att chatbots i många fall fortfarande kommer att kunna kommunicera på ett övertygande sätt. "Den 41 procentiga framgångsfrekvensen tyder på att AI-modeller redan kan ha förmågan att lura, särskilt i situationer där människor är mindre uppmärksamma på möjligheten att de kanske inte pratar med en människa", konstaterar forskarna. AI-modeller som robust efterliknar människor kan ha breda sociala och ekonomiska konsekvenser."
Forskarna observerade att deltagare som korrekt identifierade AI med människor fokuserade på flera faktorer. En modell som är för formell eller för informell väcker misstankar. Om deras uttryck är för ordrikt eller för kortfattat, om deras grammatik eller interpunktion är ovanligt bra eller "inte övertygande" dåligt, kommer det också att vara en nyckelfaktor för att avgöra om deltagarna interagerar med människor eller maskiner. Dessutom var deltagarna känsliga för svar som lät för generiska.
Forskarna föreslår att spårning av AI-modeller kommer att bli allt viktigare eftersom de blir mer flytande och absorberar mer mänskliga egenheter. "Att identifiera faktorer som leder till bedrägeri och strategier för att mildra det kommer att bli allt viktigare", sa de. Studien avslöjar att området intelligent konversation fortfarande står inför utmaningar, men ger också användbara insikter om hur AI-modeller kan förbättras.
