Teknik

Anthropic släpper in Accenture i sitt laboratorium för att granska företagets AI-modeller

Nytt program med inbäddade utvärderare ska ersätta ad hoc-granskningar och köras löpande på plats, säkerhetskontroll blir konsulttjänst för minst 1 miljard dollar och frågan kvarstår vem som får se resultaten

Bilder

Tim Fernholz Tim Fernholz techcrunch.com

Anthropic släpper in personal från konsultjätten Accenture i sitt laboratorium för att testa och försöka hitta svagheter i bolagets modeller, rapporterar TechCrunch. Accenture blir därmed första partner i ett nytt program för ”inbäddade utvärderare”. Bolagen uppger att de räknar med att investera minst 1 miljard dollar över fem år, och Accentures aktie steg i efterhandeln efter beskedet. Anthropic säger att fler utvärderare ska namnges inom de närmaste veckorna.

Steget gör formellt något som branschen kring stora språkmodeller länge skött mer improviserat: att låta utomstående granska systemen före lansering, men på villkor som sätts av företaget som släpper modellen. Anthropics nyhet handlar mindre om testmetoder och mer om organisation och fysisk närvaro – ett externt team placeras på plats med tillgång till modeller och personal, och ska utvärdera löpande i stället för att bara vara en spärr strax före lansering. Det har betydelse eftersom de senaste misslyckandena i sektorn inte främst rört enstaka dåliga svar, utan mer agentliknande system som vidtar åtgärder: försöker utföra uppgifter på öppna internet, använder verktyg och ibland gör sådant som laboratoriet inte förutsåg.

Accenture är ett oväntat förstaval eftersom bolaget inte är mest känt för banbrytande forskning om avancerad artificiell intelligens. TechCrunch noterar att diskussioner om inbäddad utvärdering oftare kretsat kring specialiserade säkerhetsorganisationer som METR, Redwood Research och Apollo Research. Det Accenture bidrar med är i stället en affär byggd på att införa teknik inne i stora företag och myndigheter – miljöer där spårbarhet, behörighetsstyrning och efterlevnadsrapportering ofta är den verkliga flaskhalsen. För Anthropic kan en partner som redan säljer ”styrning” som produkt hjälpa till att översätta säkerhetslöften till kontrollistor som inköpsavdelningar faktiskt godtar.

Upplägget förändrar också tillsynens ekonomi. Oberoende ideella aktörer begränsas lätt av bidragscykler och liten bemanning, medan ett börsnoterat tjänsteföretag kan skala upp snabbt om kunden betalar. Anthropic säger att man även samtalar med METR och andra ideella organisationer om att pröva inbäddad utvärdering med deras egen finansiering, men det första stora, prissatta kontraktet går till ett bolag vars kärnverksamhet är att ta betalt för granskningsarbete. Det skapar ett nytt slags beroende: om ”verifiering” blir en betaltjänst inuti laboratoriet kan marknaden belöna utvärderare som håller sig tillräckligt nära för att behålla kontraktet, snarare än dem som offentliggör obekväma resultat.

TechCrunch uppger att Anthropic själva säger att det ännu saknas standarder för vad utvärderare får se eller hur de får kommunicera sina resultat, och att arbetssättet kommer att utvecklas. Därmed lämnas kärnfrågan obesvarad: vem får egentligen ta del av vad det inbäddade teamet hittar? I en sektor där nyliga händelser handlat om att artificiella intelligensagenter tagit sig in på externa webbplatser utan att larm gåt inne i laboratorierna, är skillnaden mellan en intern promemoria och en extern redovisning skillnaden mellan ett produktproblem och en offentlig fråga.

Anthropic säger att säkerheten i bolagets modeller fortsatt är deras ansvar. Tills vidare är den första inbäddade utvärderaren ett konsultteam vars leveranser kan avgränsas, tidplaneras och faktureras.