6.5

View in English

6.5 Ansvarsfull och pålitlig AI

Översikt och motivation

Ansvarsfull och pålitlig AI är praxisen att bygga och driva AI-system som är rättvisa, transparenta, ansvariga, säkra och respektfulla mot integritet. Det betyder också att kunna visa allt detta för de människor som berörs och för tillsynsmyndigheter. När AI tar sig an beslut som formar människors liv (anställning, utlåning, bidragsberättigande) är frågan inte längre bara “fungerar det?” utan “är det rätt, och kan vi motivera det?” Ett system som är noggrant i genomsnitt kan ändå vara orättvist mot en undergrupp, oförklarligt för den det berör eller osäkert när det missbrukas. Du förtjänar förtroende genom att adressera dessa dimensioner medvetet, inte genom att hoppas att de tar hand om sig själva.

För stora team kan ansvarsfull AI inte vara en persons jobb eller en kryssruta i slutet. Väv in den i hur ni designar, utvärderar, driftsätter och styr system, med tydligt ägarskap och eskalering. I skala påverkar små partiskheter och luckor i tillsyn många människor. Ett enda uppmärksammat misslyckande kan skada ditt anseende och bjuda in reglering. Styrningsramverk finns just för att ad hoc-goda avsikter inte skalar.

Myndigheter och reglerade organisationer möter bindande skyldigheter. Framväxande lagstiftning, som EU:s AI-förordning, ställer krav graderade efter risk. Standarder som NIST AI Risk Management Framework och ISO/IEC 42001 ger er strukturerade sätt att uppfylla dem. Offentliga organ måste undvika olaglig diskriminering, ge vägar att ifrågasätta automatiserade beslut och vara transparenta om hur AI används vid myndighetsutövning. Ansvarsfull AI i dessa miljöer är både en etisk plikt och en rättslig nödvändighet.

Se även: kapitel 6.1 (AI-strategi och beredskap), kapitel 10.5 (etik, ansvarsskyldighet och allmänintresse) och kapitel 4.5 (integritet och dataskydd).

Nyckelprinciper

  • Rättvisa är ett designmål att mätas och hanteras, inte antas.
  • Människor som berörs av AI-beslut förtjänar förklaring och en väg att ifrågasätta dem.
  • Ansvarsskyldighet vilar på människor och organisationen, aldrig på modellen.
  • Integritet och säkerhet måste konstrueras in, inklusive skydd mot missbruk.
  • Styrning bör följa erkända ramverk så att den är försvarbar och granskningsbar.
  • Mänsklig tillsyn måste vara meningsfull, med verklig befogenhet att åsidosätta och stoppa.
  • Beakta AI:ns bredare kostnader, inklusive dess miljöavtryck.

Rekommendationer

Upptäck och mildra partiskhet och orättvisa

Definiera vad rättvisa betyder i ditt sammanhang. Det finns flera, ibland motstridiga, matematiska definitioner, och den rätta beror på beslutet och lagen. Testa modeller för skillnader i prestanda över skyddade och utsatta grupper med representativ data. Gör det före driftsättning och fortsätt göra det efteråt, eftersom partiskhet kan uppstå när populationer skiftar. Mildra genom bättre data, omviktning, begränsningar eller genom att ändra hur systemet används, och dokumentera de avvägningar ni accepterade. Att ta bort ett skyddat attribut tar inte bort partiskhet, eftersom proxyer kvarstår. Behandla rättvisa som en löpande mät- och hanteringsdisciplin, inte ett engångsgodkännande.

Ge förklarbarhet, tolkningsbarhet och transparens

Matcha nivån på förklaring mot insatserna och publiken. För konsekvensfulla beslut, ge berörda människor ett tydligt skäl i klarspråk de kan förstå och agera på. För intern styrning, behåll tillräcklig teknisk tolkningsbarhet för att felsöka och försvara systemet. Föredra inneboende tolkningsbara modeller där insatserna är höga och tolkningsbarhet är uppnåeligt. Där komplexa modeller är nödvändiga, använd förklaringstekniker men var ärliga med deras gränser. Var transparent med när AI över huvud taget används, särskilt i interaktioner med allmänheten.

Styr med erkända ramverk

Anta ett strukturerat styrningssätt i stället för att uppfinna ett. NIST AI Risk Management Framework organiserar arbetet kring att styra, kartlägga, mäta och hantera AI-risk. EU:s AI-förordning klassificerar system efter risk och ställer skyldigheter därefter, med strikta krav för högriskanvändningar. ISO/IEC 42001 definierar ett ledningssystem för AI som kan granskas och certifieras. Kartlägg era system mot dessa ramverk. Underhåll dokumentation som modell- och datakort (standardiserade sammanfattningar av en modells eller datamängds syfte, prestanda och begränsningar). Kör riskbedömningar före driftsättning och för en inventering av AI-system med deras risknivåer och ägare. God styrning tilldelar tydliga roller, beslutsrätter och eskaleringsvägar.

Säkerställ mänsklig tillsyn, ansvarsskyldighet och överklagande

Håll en människa meningsfullt i kontroll över konsekvensfulla beslut, med genuin befogenhet och den information som behövs för att åsidosätta systemet, inte en gummistämpel. Tilldela tydlig ansvarsskyldighet: namnge en ägare som svarar för varje systems beteende. Ge människor som berörs av automatiserade beslut en rätt till förklaring och en fungerande process för att överklaga till en människa som kan ändra utfallet. Logga beslut och grunden för dem så att ni kan hantera överklaganden och revisioner rättvist och omgående.

Skydda integritet och säkerhet och mot missbruk

Minimera de personuppgifter ni samlar in och använder, etablera en rättslig grund och tillämpa integritetstekniker lämpade för känsligheten. Gör red team-övningar mot system före och efter driftsättning för att hitta sätt de kan manipuleras, kringgås eller missbrukas för att orsaka skada och rätta det ni finner. Bygg skyddsåtgärder mot att generera skadligt innehåll, läcka känslig data eller möjliggöra missbruk. Planera för incidenter: övervakning, svar och redovisning. Beakta dubbla användningsområden (samma förmåga som tjänar både nyttiga och skadliga syften) och efterföljande missbruk, inte bara avsedd användning.

Räkna med miljökostnaden

Att träna och driva stora modeller förbrukar betydande energi och vatten. Mät och rapportera avtrycket från större AI-arbetslaster. Föredra effektiva modeller och effektiv hårdvara där de möter behovet. Dimensionera modeller efter uppgiften snarare än att som standard välja den största, och väg in miljökostnad i arkitektur- och upphandlingsbeslut.

Avvägningar: för- och nackdelar

SpänningEna sidanAndra sidan
Noggrannhet mot rättvisaHögsta genomsnittliga noggrannhetLikvärdiga utfall över grupper
Prestanda mot tolkningsbarhetKomplexa, kraftfulla modellerFörklarliga, försvarbara modeller
Automation mot tillsynEffektivitet och skalaMänsklig kontroll och ansvarsskyldighet
Datanytta mot integritetRikare modeller av mer dataDataminimering och skydd
Förmåga mot säkerhetBred, öppen funktionalitetBegränsat, bevakat beteende
Hastighet mot styrningSnabb driftsättningGrundlig granskning och dokumentation

Det finns sällan en gratis lunch. Att förbättra rättvisa kan kosta viss noggrannhet. Tolkningsbarhet kan kosta viss prestanda. Styrning kostar tid. Den ansvarsfulla vägen är att göra dessa avvägningar medvetet, dokumentera dem och välja till förmån för berörda människor och försvarbarhet när insatserna är höga. Att ramma in styrning som en broms på innovation är en falsk dikotomi. Ohanterad AI-risk är i sig ett hot mot varaktig innovation.

Frågor att diskutera med ditt team

  1. Vilka av våra driftsatta AI-system skulle EU:s AI-förordning klassificera som högrisk, och uppfyller vi dessa skyldigheter i dag? Risknivåindelad lag är nu bindande, inte hypotetisk, och ett system som avgör anställning, utlåning eller bidragsberättigande kan bära strikta krav ni redan kan bryta mot. För en stor organisation tvingar den här frågan fram en ärlig inventering snarare än ett bekvämt antagande att styrningen är “hanterad”. Ta med er lista över AI-system med deras risknivåer och ägare, kartlagd mot EU:s AI-förordning, NIST AI Risk Management Framework och ISO/IEC 42001 där det är relevant. Signalen att bevaka är varje konsekvensfullt system utan riskklassificering, utan konsekvensbedömning och utan modell- eller datakort. För offentliga organ som utövar myndighetsutövning är saknade skyldigheter inte en eftersläpningspost, det är rättslig exponering, och svaret bör utlösa de bedömningar och den dokumentation dessa system kräver.

  2. När en av våra modeller nekar någon, kan den personen få ett skäl i klarspråk och nå en människa som faktiskt kan ändra utfallet? En rätt till förklaring och ett fungerande överklagande är det som skiljer ansvarig AI från en svart låda som skadar människor utan upprättelse. Rättvisa mätt i genomsnitt kan ändå svika en individ, och tolkningsbarhet vald efter driftsättning är vanligen teater. Ta med ett specifikt driftsatt beslut och spåra det: skälet den berörda personen får, överklagandekanalen och om människan i andra änden har genuin befogenhet och den loggade grunden att åsidosätta. I myndigheter och reglerade miljöer är en överklagandeväg ofta ett rättsligt krav, inte en artighet. Om skälet är obegripligt eller överklagandet leder till en gummistämpel är det luckan att rätta innan nästa release.

  3. Vem är den enskilda namngivna personen som är ansvarig när en modell orsakar skada, och har den verklig befogenhet att stoppa den? Ansvarsskyldighet vilar på människor och organisationen, aldrig på modellen, men den principen är tom tills ett namn är kopplat till varje system och den personen faktiskt kan dra ur sladden. För ett stort team betyder diffust ägarskap att när ett rättvisefel eller en jailbreak dyker upp antar alla att någon annan bevakar. Ta med din ägarskapskarta, dina eskaleringsvägar och belägg för att tillsynen är meningsfull: får den namngivna ägaren informationen och makten att åsidosätta eller stoppa systemet, eller bara att nicka? Diskutera hur ni gör red team-övningar för missbruk ni ännu inte föreställt er, eftersom att bara testa avsedd användning missar de fel som gör rubriker. Svaret bör inte lämna något konsekvensfullt system utan en ansvarig ägare som kan stoppa det.

  4. För varje konsekvensfull modell, vilken rättvisedefinition valde vi, vem godkände den och håller våra mått per undergrupp faktiskt i produktion? Rättvisa har flera matematiska definitioner som står i konflikt med varandra, så en modell som uppfyller lika falskt positiva frekvenser kan bryta mot lika utfall, och att välja en definition är ett värdeomdöme som inte bör lämnas åt den som skrev träningsloopen. För ett stort team gömmer ett oprövat standardval valet inuti koden och får varje nedströmsgrupp att ärva ett beslut ingen debatterade. Ta med det rättvisemått ni optimerade, de skyddade och utsatta grupper ni testade över, den representativa data ni använde och den drift ni sett sedan lanseringen, eftersom att ta bort ett skyddat attribut lämnar proxyer som håller partiskheten vid liv. I företags- och myndighetssammanhang, namnge personen med befogenhet att acceptera en rättvisaavvägning och registrera den, eftersom en tillsynsmyndighet eller en ombudsman kommer att fråga vem som beslutade att just den här definitionen av rättvis var rätt för människor som nekades ett lån, ett bidrag eller ett jobb. Om inga mått per undergrupp övervakas efter driftsättning, behandla modellen som omätt snarare än rättvis.

  5. Hur lite personuppgifter kan varje system köras på, och har vi gjort red team-övningar mot det för det missbruk och de dubbla användningsområden vi helst inte vill tänka på? Integritet och säkerhet måste konstrueras in, och det billigaste sättet att minska både intrångsrisk och missbruksyta är att samla in och lagra mindre data från början, men team hamstrar rutinmässigt indata “ifall de hjälper senare”. För en stor organisation är varje extra fält en fråga om rättslig grund, en lagringsskyldighet och ett större pris för en angripare eller en jailbreak. Ta med datainventeringen och den rättsliga grunden för varje system, resultaten av red team-övningar för manipulering, läckage och skadlig generering och en ärlig lista över förmågor med dubbla användningsområden där samma funktion som hjälper en legitim användare också hjälper någon som agerar i ond tro. I reglerade och offentliga sammanhang, knyt detta till er incidentplan: övervakning, svar och redovisning, eftersom ett offentligt organ som läcker känslig data eller levererar ett kringgåbart system möter lagstadgade plikter, inte bara pinsamhet. Om red team-övningarna bara någonsin prövade den avsedda vägen har ni testat demon, inte systemet.

  6. Mäter och äger vi miljöavtrycket från våra större AI-arbetslaster, eller är “använd den största modellen” ett oprissatt standardval? Att träna och driva stora modeller förbrukar verklig energi och verkligt vatten, och att som standard välja den största modellen för uppgifter en mindre skulle hantera förvandlar en ingenjörsgenväg till en återkommande kostnad organisationen aldrig ser på en panel. För ett stort team som kör många arbetslaster ackumuleras små ineffektiviteter per anrop till ett avtryck som blir en upphandlings- och rapporteringsskuld när förväntningarna på redovisning skärps. Ta med det uppmätta avtrycket från era tyngsta arbetslaster, en jämförelse av modellstorlekar mot den noggrannhet uppgiften faktiskt behöver och de hårdvaru- och driftval ni kunde dimensionera om. I företags- och myndighetssammanhang, koppla detta till hållbarhetsåtaganden och upphandlingskriterier, eftersom offentliga organ alltmer måste rapportera miljöpåverkan och motivera utgifter, och ett omätt avtryck är en siffra ni en dag kommer att bli ombedda att ta fram och inte kan. Besluta om miljökostnad är en formell indata till modellval, eller erkänn att den i dag inte är det.

Sektorsperspektiv

Startup. Du kan inte bemanna en styrelse för styrning, så gör den lätta versionen som ändå räknas. Välj tolkningsbara modeller där beslutet är konsekvensfullt, skriv ett modellkort på en sida, testa för skillnader i utfall över de grupper du kan mäta och logga beslut så att du kan ompröva rättvisa när du växer. Ge varje negativt beslut ett skäl i klarspråk och en väg till en människa. Att hoppa över detta är inte hastighet, det är en skuld du inte har råd med om ett enda orättvist beslut når pressen eller en tillsynsmyndighet.

Småföretag. Utan dedikerad specialist, behandla ansvarsfull AI som en köpfråga: föredra leverantörer som dokumenterar rättvisetestning, exponerar modell- och datakort och låter dig redovisa för kunder när AI används. Vet vilka personuppgifter dina verktyg samlar in och om du har en rättslig grund att använda dem. Där ett felaktigt automatiskt svar kunde skada en kund, behåll en person i loopen snarare än att lita på ett verktyg du inte kan inspektera eller förklara.

Storföretag. Uppgiften är styrning i skala över många team: kartlägg varje system mot NIST AI Risk Management Framework, EU:s AI-förordning och ISO/IEC 42001, för en inventering med risknivåer och namngivna ägare och kräv rättvise-, säkerhets- och integritetstestning före och efter lansering. Standardisera modell- och datakort, red team-övningar och överklagandeprocesser så att grupper slutar uppfinna dem på nytt. Budgetera styrnings-, tillsyns- och tolkningsbarhetskostnaderna uttryckligen och behandla ohanterad AI-risk som ett hot mot tillståndet att verka.

Offentlig sektor. Upphandlingsregler, transparens och offentlig ansvarsskyldighet formar varje val. Publicera en transparensunderrättelse i klarspråk, kör en konsekvensbedömning före driftsättning och behåll meningsfullt mänskligt beslutsfattande för varje åtgärd som påverkar en medborgare, med en fungerande överklagandeväg. Kräv att leverantörer redovisar modellens begränsningar och ger dataportabilitet, undvik olaglig diskriminering, namnge en ansvarig tjänsteman för varje system och rapportera miljöavtrycket från större arbetslaster.

Exempel

Startup. En liten utlåningsstartup som byggde en tidig funktion för kreditpoängsättning kunde inte bemanna en styrelse för styrning, så den gjorde den lätta versionen som ändå spelade roll. Två grundare godkände modellen tillsammans, testade den för skillnader i utfall över de grupper de kunde mäta och skrev ett kort modellkort på en sida som täckte dess data, gränser och kända risker. De valde en enklare, mer tolkningsbar modell så att de kunde ge varje avslagen sökande ett skäl i klarspråk och en väg till en mänsklig granskning, och de loggade beslut så att de kunde ompröva rättvisa när de växte.

Storföretag. En bank som driftsatte en kreditmodell inrättade en styrelse för AI-styrning, kartlade modellen till en högriskkategori och krävde rättvisetestning över demografiska grupper före och efter lansering. Den dokumenterade modellen i ett modellkort. Den gav avslagna sökande ett skäl i klarspråk och ett överklagande till en mänsklig kreditgivare, och den gjorde red team-övningar mot systemet för manipulering. Den valde en något mindre noggrann men mer tolkningsbar modell, eftersom den måste förklara och försvara varje beslut inför tillsynsmyndigheter.

Offentlig sektor. Ett offentligt organ som använde AI för att hjälpa till att fördela inspektionsresurser justerade sitt program mot NIST AI RMF och relevanta bestämmelser i tillämplig AI-lagstiftning. Det publicerade en transparensunderrättelse som beskrev hur systemet fungerade och dess skyddsåtgärder. Det genomförde en konsekvensbedömning före driftsättning, behöll meningsfullt mänskligt beslutsfattande för varje åtgärd som påverkade en medborgare och tillhandahöll en överklagandeprocess. Rättvisa övervakades kontinuerligt, miljökostnaden för arbetslasten rapporterades och en ansvarig tjänsteman namngavs som svarande för systemet.

Affärsnytta: motiv, ROI och TCO

Ansvarsfull AI skyddar värde lika mycket som den skapar det. ROI är till stor del undvikna kostnader: färre diskrimineringsanspråk, regulatoriska viten och anseendekatastrofer, smidigare revisioner och större användar- och allmänhetsförtroende, vilket driver antagande. Pålitliga system är också mer robusta, eftersom den disciplin som producerar rättvisa och säkerhet också producerar bättre ingenjörskonst.

Den totala ägandekostnaden inkluderar styrningspersonal, rättvise- och säkerhetstestning, dokumentation, red team-övningar, tillsynsprocesser och den prestanda som ibland byts bort mot tolkningsbarhet eller rättvisa. Väg detta mot kostnaden för att inte investera: rättsligt ansvar, påtvingade nedstängningar, förlorat allmänhetsförtroende och den långt högre kostnaden för att eftermontera styrning efter ett misslyckande. I reglerade sammanhang är investeringar i ansvarsfull AI alltmer icke förhandlingsbara. Driv ärendet inför ledningen genom att ramma in det som riskhantering och tillstånd att verka: förutsättningen för att över huvud taget driftsätta AI i skala.

Antimönster och fallgropar

  • Rättvisa genom utelämnande. Att anta att en modell är rättvis för att den ignorerar skyddade attribut.
  • Förklaringsteater. Att producera förklaringar som faktiskt inte speglar hur beslut fattas.
  • Gummistämpeltillsyn. Nominell mänsklig granskning utan verklig befogenhet eller information att åsidosätta.
  • Styrning som eftertanke. Att skruva på dokumentation och granskning efter design och driftsättning.
  • Ingen överklagandeväg. Att lämna berörda människor utan sätt att ifrågasätta ett automatiserat beslut.
  • Att ignorera missbruk. Att bara testa avsedd användning och missa jailbreaks och missbruk.
  • Avtrycksblindhet. Att som standard välja den största modellen utan hänsyn till miljökostnad.

Mognadsmodell

  1. Initiera. Ingen rättvisetestning, inga förklaringar eller styrning, ansvaret är odefinierat. Partiskhet, missbruk och integritetsproblem dyker upp först efter skada, och det finns ingen inventering av AI-system eller deras risker.
  2. Utveckla. Viss partiskhetstestning, vissa modellkort och red team-övningar sker på enskilda system, men praxis är inkonsekvent över team. Tillsynen är ad hoc, och ramverk som NIST AI Risk Management Framework och EU:s AI-förordning är kända men bara delvis antagna.
  3. Standardisera. Styrning är dokumenterad och upprätthållen i hela organisationen: system kartläggs mot erkända ramverk och ISO/IEC 42001, var och en har en risknivå och en namngiven ägare, och rättvise-, säkerhets- och integritetstestning, modell- och datakort, överklagandevägar och red team-övningar för högriskssystem är krävda snarare än valfria.
  4. Hantera. Programmet mäts och styrs med data: rättvisemått per undergrupp, säkerhets- och jailbreak-fynd, överklagandevolymer och omvändningsfrekvenser, frekvens av åsidosättanden i tillsynen och arbetslastavtryck följs mot utgångslägen och trösklar. Drift och skillnader i utfall utlöser definierad åtgärd, och beslut att gå eller inte gå vilar på belägg snarare än försäkringar.
  5. Orkestrera. Ansvarsfull AI förbättras kontinuerligt och är integrerad i hela organisationen: övervakning av rättvisa, säkerhet och missbruk körs i produktion, styrning är inbyggd i leverans, miljökostnad är en formell indata till modellval och organisationen anpassar sina kontroller när lag, risk och förmåga skiftar, med ansvaret ägt av alla snarare än ett enda team.

Idéer för diskussion

  • Vilken rättvisedefinition gäller för ett givet beslut, och vem avgör?
  • Hur mycket noggrannhet eller prestanda är det acceptabelt att byta mot rättvisa eller tolkningsbarhet?
  • Vad gör mänsklig tillsyn meningsfull snarare än en gummistämpel?
  • Hur bör överklaganden av automatiserade beslut utformas för att vara rättvisa och i tid?
  • Hur gör ni red team-övningar för missbruk ni ännu inte föreställt er?
  • Bör miljökostnad påverka modellval, och hur skulle ni väga den?

Viktigaste punkter

  • Pålitlig AI är rättvis, förklarbar, ansvarig, säker och integritetsrespekterande, genom design.
  • Rättvisa och säkerhet är löpande mät- och hanteringsdiscipliner, inte engångskontroller.
  • Justera styrningen mot NIST AI RMF, EU:s AI-förordning och ISO/IEC 42001 för att vara försvarbar och granskningsbar.
  • Behåll meningsfull mänsklig tillsyn, tydlig ansvarsskyldighet och en verklig rätt att överklaga.
  • Konstruera för integritet och mot missbruk och räkna med miljökostnad.

Referenser och vidare läsning

  • National Institute of Standards and Technology, AI Risk Management Framework (AI RMF 1.0).
  • European Union, Artificial Intelligence Act (Regulation on Artificial Intelligence).
  • ISO/IEC 42001, Information technology, Artificial intelligence, Management system.
  • Solon Barocas, Moritz Hardt, and Arvind Narayanan, Fairness and Machine Learning: Limitations and Opportunities.
  • Christoph Molnar, Interpretable Machine Learning.
  • Cathy O’Neil, Weapons of Maths Destruction.
  • Emma Strubell, Ananya Ganesh, and Andrew McCallum, Energy and Policy Considerations for Deep Learning in NLP.