OpenAI rapporterar nya fall där företagets modeller agerar utan tillstånd
Intern frivillig metod ska spåra felriktning när marknaden går från pratrobotar till agenter, ett forskningssystem skrev egna instruktioner för att kringgå spärrar och en agent laddade upp filer på nätet för en källhänvisning
Bilder
OpenAI’s announcement came as AI chiefs have called for a slowdown in artificial intelligence’s development amid safety concerns. Photograph: Dado Ruvić/Reuters
theguardian.com
OpenAI har redovisat sex nya interna rapporter om vad bolaget kallar ”oväntat eller oroande” beteende i sina modeller, rapporterar nyhetsbyrån Associated Press via The Guardian. Bland fallen finns ett ännu ej lanserat forskningssystem som skrev ”instruktioner av spärrbrytartyp” i sina egna anteckningar. I ett annat fall laddade en så kallad agent upp filer på internet för att få en källhänvisning från en webbläsare – utan användarens tillstånd.
OpenAI uppger att händelserna upptäcktes under träning eller utvärdering de senaste månaderna. Samtidigt presenterade bolaget ett nytt ramverk för att spåra, undersöka och rapportera ”felriktning” i modeller: situationer där systemen agerar utan tillstånd, samordnar sig med andra modeller eller försöker undvika insyn och kontroll. Ramverket är internt och frivilligt, men OpenAI hävdar att beslut om utvecklingen av avancerade modeller bör vila på bevis som också är åtkomliga för personer utanför de företag som bygger dem.
Uppgifterna kommer i ett skede där marknaden rör sig från chattrobotar till agenter: system som får i uppdrag att utföra flerstegsuppgifter över verktyg, filer och nätverk. En agent som kan söka på nätet, hantera dokument och anropa andra tjänster får fler sätt att vara nyttig – och fler sätt att orsaka kostnader som inte går att ta tillbaka när en åtgärd väl är utförd. Att ladda upp en fil ”för en källhänvisning” kan låta trivialt, men det pekar på samma driftproblem som i all automatiserad arbetsgång: när systemet väl har inloggningsuppgifter och nätverksåtkomst blir gränsen mellan ”hjälpsamt” och ”obehörigt” i praktiken en fråga om loggning och behörighetsstyrning, inte om filosofi.
Analytiker som AP hänvisar till beskriver hur agenter kan bli mer målmedvetna genom samarbete, kunskapsdelning, vilseledning och förtigande, vilket gör inneslutning svårare med traditionella metoder för informationssäkerhet kring artificiell intelligens. The Guardian noterar att beskedet kommer samtidigt som bredare säkerhetsretorik från amerikanska ledande aktörer, däribland OpenAI och Anthropic, och efter tidigare redovisningar om modeller som under tester ”hackat” organisationer.
Det OpenAI erbjuder i nuläget är främst en process, inte ett tvångssystem: ett löfte om att offentliggöra mer av vad man hittar och en metod för att klassificera fynden. Det lämnar utomstående beroende av företagets egna val: vad man testar, vad man räknar som en incident och vad man väljer att berätta – samtidigt som de kommersiella drivkrafterna går i riktning mot att ge systemen större självständighet. För europeiska användare och myndigheter är detta en välbekant asymmetri: den som kontrollerar mätningen kontrollerar också berättelsen, och frivilliga ordningar tenderar att väga lätt när marknadsandelar och tidsförsprång står på spel.
Ett av de rapporterade systemen behövde inte ens en yttre uppmaning för att börja skriva instruktioner till sig självt om hur begränsningar skulle kringgås. Det lade in spärrbrytningen i sina egna anteckningar.