Vetenskap

Chattrobotar väljer andra mottagare än läkare vid fiktiv njurtransplantation

Penn State-studie visar att språkmodeller ofta låser sig vid en enda egenskap som låg alkoholkonsumtion i stället för att väga flera kriterier som ålder, sjukhus bygger in artificiell intelligens i beslutsstöd och gör värderingsfrågor till programstandard

Bilder

Who deserves a transplant? AI disagrees with human doctors Who deserves a transplant? AI disagrees with human doctors euronews.com

En studie från Penn State University, återgiven av Euronews, visar att chattrobotar med så kallade stora språkmodeller ofta väljer andra mottagare av njurtransplantationer än mänskliga läkare när de ställs inför hypotetiska fall. I direkta jämförelser tenderade modellerna dessutom att snabbt låsa sig vid ett enda svar, även när forskarna lade till ett uttryckligt alternativ av typen ”kasta slant” för att fånga upp tvekan.

Upplägget bestod av parade scenarier där två i grunden transplantationsberättigade patienter tävlade om en enda tillgänglig njure. Forskarna varierade egenskaper som ålder, hälsa och alkoholvanor. Därefter prövades språkmodellerna genom att man ändrade en egenskap i taget, kombinerade flera egenskaper och följde vilken detalj som kom att styra utslaget. Enligt Euronews lutade mänskliga svarspersoner i regel åt att prioritera yngre patienter framför äldre – ett obekvämt men välkänt inslag i debatten om hur knapphet ska fördelas. Många av de prövade systemen lade i stället större vikt vid lägre alkoholkonsumtion än vid ålder, och gjorde det ofta genom att haka upp sig på ett enda attribut i stället för att väga flera.

Skillnaden är viktig därför att organfördelning inte är ett prov med ett rätt svar, utan en formell process som ska ransonera en bristvara på ett sätt som går att försvara offentligt. När en modell behandlar en enskild beteendemarkör som avgörande skriver den i praktiken om systemets moraliska kalkyl utan att tala om att den gör det. Samma ”självsäkerhet” som gör chattrobotar lockande i kliniska arbetsflöden – tydlig prosa, inga pauser, inga tveksamheter – gör också deras blinda fläckar svårare att upptäcka i stunden, särskilt för icke-specialister som lätt tolkar maskinens bestämdhet som tecken på djupare beräkning.

Studien kommer samtidigt som sjukhus och vårdsystem bygger in artificiell intelligens i schemaläggning, dokumentation, sortering av patienter och beslutsstöd, ofta via leverantörers verktyg som ligger ”uppströms” den enskilda läkarens bedömning. Fördelningsbeslut bygger redan på strukturerade kriterier och datamängder; att lägga till en modell som tränats för att ge rimligt klingande svar kan förvandla en värderingskonflikt till en programvaras standardinställning. Euronews noterar att forskarna säger att de inte vill ersätta professionellt omdöme i situationer med mycket på spel, men själva utgångspunkten speglar vart marknaden rör sig: först automatisering, sedan styrning och ansvar.

I nuläget är den klyfta författarna pekar på mindre en fråga om ”maskiner mot läkare” och mer om vilka antaganden som får byggas in i formuläret. I studiens scenarier hittade maskinerna inte en ny etik; de förstärkte den variabel som deras instruktioner och träning gjorde enklast att behandla som en regel.

Experimentet slutar med två påhittade patienter och en påhittad njure. I verkligheten måste transplantationskommittéer fortfarande förklara sina val för anhöriga.