6.5

查看英文版

6.5 负责任且值得信赖的 AI

概述与动机

负责任且值得信赖的 AI,是指构建和运营公平、透明、可问责、安全,并尊重隐私的 AI 系统这项实践。它同样意味着,你能够向受影响的人和监管机构,展示这一切。随着 AI 越来越多地承担起塑造人们生活的决策(招聘、放贷、福利资格审核),问题已经不再只是”它是否有效?“,而是”它是否正确?我们能证明这一点吗?“一个平均准确率很高的系统,仍然可能对某个子群体不公平、对受它影响的人来说无法解释,或者在被误用时不安全。信任是靠有意识地处理这些维度赢得的,而不是靠指望它们自己解决而获得的。

对大型团队而言,负责任的 AI 不能是某一个人的工作,也不能是最后才打的一个勾。要把它编织进你设计、评估、部署和治理系统的整个过程中,配以清晰的归属和上报路径。在大规模场景下,微小的偏见和监督上的缺口,会影响到许多人。一次引人瞩目的失败,就可能损害你的声誉,并招致监管介入。治理框架之所以存在,正是因为临时起意的良好意图无法规模化。

政府和受监管的组织,面临着具有约束力的义务。新出台的法律,比如《欧盟人工智能法案》,按风险等级施加相应要求。NIST 人工智能风险管理框架和 ISO/IEC 42001 等标准,为你提供了满足这些要求的结构化方法。公共机构必须避免非法歧视,为质疑自动化决策提供途径,并就 AI 在行使公权力过程中的使用方式保持透明。在这些场景中,负责任的 AI 既是一项伦理义务,也是一项法律必需。

另见: 第 6.1 章(AI 战略与准备度)、第 10.5 章(伦理、问责与公共利益),以及第 4.5 章(隐私与数据保护)。

关键原则

  • 公平性是一个需要被度量和管理的设计目标,而不是可以想当然的假设。
  • 受 AI 决策影响的人,应当获得解释,以及质疑这些决策的途径。
  • 问责由人和组织来承担,绝不能由模型来承担。
  • 隐私和安全必须被融入工程设计之中,包括防范滥用和误用的保护措施。
  • 治理应遵循公认的框架,这样才具有可辩护性和可审计性。
  • 人类的监督必须是实质性的,拥有真正的权力去否决和叫停系统。
  • 要考虑 AI 更广泛的代价,包括它的环境足迹。

建议

检测并缓解偏见与不公平

明确界定公平性在你所处的场景中意味着什么。存在多种、有时相互冲突的数学定义,选择哪一种取决于具体的决策和法律。使用具有代表性的数据,测试模型在受保护群体和弱势群体之间是否存在表现差异。要在部署之前这样做,部署之后也要持续这样做,因为随着人群结构的变化,偏见也可能随之出现。通过改善数据、重新加权、施加约束,或改变系统的使用方式来缓解偏见,并把你所接受的权衡取舍记录下来。移除一个受保护属性并不能消除偏见,因为代理变量依然存在。把公平性当作一项持续进行的度量和管理工作,而不是一次性的过关认证。

提供可解释性、可理解性和透明度

让解释的深度与利害关系和受众相匹配。对于影响重大的决策,要向受影响的人提供清晰、通俗易懂的理由,让他们能够理解并据此采取行动。对于内部治理而言,要保留足够的技术层面可理解性,以便调试和辩护这个系统。在利害关系高、且可理解性可以实现的场合,优先选择本质上就具备可理解性的模型。在确实需要复杂模型的地方,使用解释技术,同时对其局限性保持诚实。要在 AI 被使用这件事本身上保持透明,尤其是在与公众互动的场合。

依据公认的框架进行治理

采用一套结构化的治理方法,而不是自己另起炉灶发明一套。NIST 人工智能风险管理框架围绕治理(govern)、映射(map)、度量(measure)和管理(manage)AI 风险来组织工作。《欧盟人工智能法案》依据风险对系统进行分类,并相应地施加义务,对高风险用途有着严格的要求。ISO/IEC 42001 定义了一套可以被审计和认证的 AI 管理体系。把你的系统对照这些框架进行映射。维护诸如模型卡和数据卡(对一个模型或数据集的用途、性能和局限性进行标准化总结的文档)之类的文档。在部署之前开展风险评估,并维护一份 AI 系统清单,记录它们的风险等级和负责人。良好的治理,会分配清晰的角色、决策权,以及上报路径。

确保人类监督、问责和申诉渠道

对影响重大的决策,让人类保持实质性的掌控,拥有真正的权力和所需的信息去否决系统,而不是走个过场。分配清晰的问责:为每个系统指定一位对其行为负责的负责人。赋予受自动化决策影响的人一项获得解释的权利,以及一个可行的流程,能够向一位有能力改变结果的真人提出申诉。记录决策及其依据,这样你就能公平、及时地处理申诉和审计。

保护隐私、安全,并防范滥用

尽量减少你收集和使用的个人数据,建立合法依据,并根据所涉及数据的敏感程度,应用相应的隐私保护技术。在部署前后都对系统进行红队测试,找出它可能被操纵、被”越狱”,或被误用来造成伤害的方式,并修复你发现的问题。构建防范措施,防止生成有害内容、泄露敏感数据,或助长滥用行为。为事件做好规划:监控、响应和披露。要考虑两用性(同一种能力既能服务于有益目的,也能服务于有害目的)以及下游的误用,而不仅仅是预期用途。

考量环境成本

训练和提供大型模型服务,会消耗大量的能源和水资源。度量并报告主要 AI 工作负载的足迹。在满足需求的前提下,优先选择高效的模型和硬件。让模型规模与任务相匹配,而不是默认选择最大的模型,并把环境成本纳入架构和采购决策的考量之中。

权衡:优点与缺点

张力一方另一方
准确率与公平性最高的平均准确率各群体之间公平的结果
性能与可理解性复杂、强大的模型可解释、可辩护的模型
自动化与监督效率和规模人类掌控与问责
数据效用与隐私更多数据带来更丰富的模型数据最小化与保护
能力与安全广泛、开放的功能受约束、受防护的行为
速度与治理快速部署充分的评审与文档记录

天下很少有免费的午餐。提升公平性,可能要付出一些准确率的代价。可理解性,可能要付出一些性能的代价。治理需要花费时间。负责任的做法,是有意识地做出这些权衡,把它们记录下来,并在利害关系重大时,倾向于选择对受影响的人有利、且经得起辩护的一方。把治理框定为创新的绊脚石,是一种虚假的二分法。不受管理的 AI 风险本身,就是对持续创新的一种威胁。

与团队讨论的问题

  1. 我们已部署的哪些 AI 系统会被《欧盟人工智能法案》归类为高风险?我们今天是否达到了那些义务要求? 按风险分级的法律如今具有约束力,而不再是假设性的,一个决定招聘、放贷或福利资格的系统,可能背负着你可能已经在违反的严格要求。对大型组织而言,这个问题迫使你做一次诚实的盘点,而不是舒适地假设治理”已经搞定了”。带上你的 AI 系统清单,记录它们的风险等级和负责人,并在相关的地方对照《欧盟人工智能法案》、NIST 人工智能风险管理框架和 ISO/IEC 42001 进行映射。需要留意的信号,是任何没有风险分类、没有影响评估、也没有模型卡或数据卡的重大系统。对于行使公权力的公共机构而言,遗漏的义务不是一项积压待办事项,而是法律风险,这个答案应该促使你们启动这些系统所需的评估和文档记录工作。

  2. 当我们的某个模型拒绝了某个人时,这个人能否得到一个通俗易懂的理由,并联系到一位真正能够推翻这个结果的真人? 获得解释的权利和一个可行的申诉渠道,正是可问责的 AI 与一个伤害人却无处申诉的黑盒之间的区别。平均意义上度量出来的公平性,仍然可能在个体身上失效,而部署之后才选定的可理解性,通常只是表演。带上一个具体的已部署决策,追溯它:受影响的人得到的理由、申诉渠道,以及另一端的那个人是否拥有真正的权力和有记录的依据去推翻这个结果。在政府和受监管的场景中,申诉渠道往往是一项法律要求,而不是一种礼貌之举。如果理由让人费解,或者申诉最终只是走个过场,那就是在下一次发布之前必须修复的缺口。

  3. 当一个模型造成伤害时,谁是那个被明确指名、需要负责的人?他们是否拥有真正的权力去叫停它? 问责由人和组织来承担,绝不能由模型来承担,但这条原则在每个系统都被赋予一个名字、且这个人真的能拔掉插头之前,都只是一句空话。对大型团队而言,分散的归属意味着,当一次公平性失效或一次”越狱”浮出水面时,每个人都会假设有别的人在盯着。带上你们的归属地图、上报路径,以及监督具有实质意义的证据:那位被指名的负责人,是否获得了否决或叫停系统所需的信息和权力,还是只能点头称是?讨论一下你们如何针对那些你们尚未设想到的滥用和误用方式进行红队测试,因为只测试预期用途,会错过那些真正登上头条的失败。这个答案应该确保,没有任何一个影响重大的系统,缺少一位能够叫停它的问责负责人。

  4. 对每一个影响重大的模型,我们选择了哪种公平性定义?谁签字批准了它?我们的子群体指标在生产环境中是否真的成立? 公平性存在多种相互冲突的数学定义,因此一个满足”相等假阳性率”的模型,可能违反”相等结果”,而选择哪种定义是一种价值判断,不应该留给写训练循环的那个人来决定。对大型团队而言,一个未经审视的默认选择,会把这个抉择藏进代码里,让下游的每一个群体都继承了一个从没人讨论过的决定。带上你们优化的公平性指标、你们测试覆盖的受保护群体和弱势群体、你们使用的具有代表性的数据,以及上线以来观察到的漂移,因为移除一个受保护属性,会留下让偏见继续存在的代理变量。在企业和政府场景中,要指明谁有权接受一项公平性权衡,并把它记录下来,因为监管机构或申诉专员会追问,是谁决定了这种对”公平”的定义,对那些被拒绝贷款、福利或工作机会的人来说是恰当的。如果部署之后没有监测任何子群体指标,就把这个模型当作”未经度量”,而不是”公平”来对待。

  5. 每个系统运行所需的个人数据能少到什么程度?我们是否针对那些我们宁愿不去想的滥用和两用场景,对它做过红队测试? 隐私和安全必须被融入工程设计之中,而降低泄露风险和滥用面最廉价的方式,就是从一开始就收集和保留更少的数据,然而团队却经常”以防日后有用”而囤积输入数据。对大型组织而言,每多一个字段,就多一个合法依据问题、一项保留义务,以及给攻击者或”越狱”行为的一份更大的奖赏。带上每个系统的数据清单和合法依据、针对操纵、泄露和有害生成所做的红队测试结果,以及一份诚实的两用能力清单()同一个帮助合法用户的功能,也可能帮助一个心怀恶意的人。在受监管和公共场景中,要把这与你们的事件应对计划联系起来:监控、响应和披露,因为一个泄露敏感数据或部署了可被”越狱”系统的公共机构,面临的是法定义务,而不仅仅是难堪。如果红队测试只演练过预期路径,那你们测试的是演示,而不是系统本身。

  6. 我们是否度量并拥有主要 AI 工作负载的环境足迹?还是说”用最大的模型”是一个没有被定价的默认选择? 训练和提供大型模型服务,会消耗真实的能源和水资源,而对一个较小模型就能胜任的任务默认选择最大的模型,会把一个工程上的捷径,变成一项组织从未在任何仪表盘上看到过的经常性成本。对运行着众多工作负载的大型团队而言,每次调用的微小低效,会不断累积成一个足迹,随着披露要求日益收紧,它会变成一项采购和报告方面的责任。带上你们负载最重的工作负载的实测足迹、模型规模与任务实际所需准确率之间的对比,以及你们本可以采取的、更合理规模的硬件和服务方案。在企业和政府场景中,要把这与可持续发展承诺和采购标准联系起来,因为公共机构越来越需要报告环境影响、证明支出的合理性,而一个未经度量的足迹,正是你有朝一日会被要求拿出来、却拿不出来的数字。要么明确决定环境成本是模型选择的一项正式输入,要么就承认今天它还不是。

行业视角

初创企业。 你们无法配备一个治理委员会,所以要做那个依然有价值的轻量版本。在决策影响重大的地方选择可理解的模型,写一份单页的模型卡,针对你们能够度量的群体测试结果差异,并记录决策,这样你们就能在成长过程中重新审视公平性。为任何不利决策提供一个通俗的理由,以及一条通向真人的渠道。跳过这一步并不是在追求速度,而是一项你们承担不起的责任风险,一旦一次不公平的决策被媒体或监管机构盯上。

小型企业。 没有专职专家,把负责任的 AI 当作一个采购问题来对待:优先选择那些记录了公平性测试、公开模型卡和数据卡、并允许你在使用 AI 时告知客户的供应商。了解你们的工具收集了哪些个人数据,以及你们是否有使用它的合法依据。在一个错误的自动化答案可能伤害到客户的地方,让一个人参与其中,而不是盲目信任一个你无法检查或解释的工具。

企业。 这里的任务是在众多团队之间实现规模化治理:把每一个系统对照 NIST 人工智能风险管理框架、《欧盟人工智能法案》和 ISO/IEC 42001 进行映射,维护一份带有风险等级和指定负责人的清单,并在上线前后都要求进行公平性、安全性和隐私测试。把模型卡和数据卡、红队测试,以及申诉流程标准化,让各个团队不再各自重复发明这些东西。明确为治理、监督和可理解性方面的成本编列预算,并把不受管理的 AI 风险,当作对经营许可本身的一种威胁来对待。

政府机构。 采购规则、透明度和公共问责,塑造着每一个选择。发布一份通俗易懂的透明度声明,在部署前开展一次影响评估,并对任何影响公民的行动,保留实质性的人类决策权,配以一条可行的申诉渠道。要求供应商披露模型的局限性,并给予数据可移植性,避免非法歧视,为每个系统指定一位负责的官员,并报告主要工作负载的环境足迹。

示例

初创企业。 一家正在构建早期信用评分功能的小型放贷初创公司,无法配备一个治理委员会,所以做了那个依然重要的轻量版本。两位创始人共同为模型签字批准,针对他们能够度量的群体测试了结果差异,并撰写了一份简短的单页模型卡,涵盖其数据、局限性和已知风险。他们选择了一个更简单、更具可理解性的模型,这样就能为任何被拒绝的申请人提供一个通俗的理由和一条通向人工复核的路径,并且他们记录了决策,以便在成长过程中重新审视公平性。

企业。 一家部署信用模型的银行,建立了一个 AI 治理委员会,把该模型映射到一个高风险类别,并要求在上线前后都要跨人口群体进行公平性测试。它在一份模型卡中记录了这个模型。它为被拒绝的申请人提供了一个通俗易懂的理由,以及向一位人工承保人提出申诉的渠道,并对该系统进行了操纵方面的红队测试。它选择了一个准确率稍低、但可理解性更强的模型,因为它必须向监管机构解释和辩护每一个决策。

政府机构。 一家使用 AI 来协助分配检查资源的公共机构,把自己的项目与 NIST 人工智能风险管理框架以及适用 AI 法律的相关条款对齐。它发布了一份透明度声明,说明该系统如何运作以及它的防护措施。它在部署前开展了一次影响评估,对任何影响公民的行动保留了实质性的人类决策权,并提供了一套申诉流程。公平性被持续监测,该工作负载的环境成本被报告出来,并且指定了一位对该系统负责的官员。

业务论证:动机、投资回报率与总拥有成本

负责任的 AI 既能保护价值,也能创造价值。它的投资回报率,很大程度上体现为避免的成本:更少的歧视诉讼、监管处罚和声誉灾难;更顺畅的审计;以及更高的用户和公众信任,而这会推动采用率的提升。值得信赖的系统同样更加稳健,因为产生公平性和安全性的那份纪律,也同样能带来更好的工程质量。

总拥有成本包括治理人员、公平性和安全性测试、文档记录、红队测试、监督流程,以及有时为了可理解性或公平性而牺牲的性能。把这些与不投入的成本相权衡:法律责任、被迫关停、公众信任的丧失,以及在一次失败之后再去补建治理体系要高昂得多的成本。在受监管的场景中,对负责任 AI 的投入,正变得越来越不容商量。要向领导层证明这一点,就把它框定为风险管理和经营许可:这是大规模部署 AI 的先决条件。

反模式与陷阱

  • 靠省略来实现公平。 因为一个模型忽略了受保护属性,就假设它是公平的。
  • 可解释性表演。 生成的解释并不真正反映决策实际是如何做出的。
  • 走过场的监督。 名义上的人工复核,却没有真正的权力或信息去否决系统。
  • 把治理当作事后补救。 在设计和部署完成之后,才把文档记录和评审硬加上去。
  • 没有申诉渠道。 让受影响的人没有任何方式去质疑一次自动化决策。
  • 忽视误用。 只测试预期用途,错过”越狱”和滥用行为。
  • 对足迹视而不见。 默认选择最大的模型,完全不考虑环境成本。

成熟度模型

  1. 初始阶段。 没有公平性测试、解释,或治理;责任归属不明确;偏见、滥用和隐私问题只在造成伤害之后才会浮出水面,也没有 AI 系统及其风险的清单。
  2. 发展阶段。 一些系统上会开展偏见测试、模型卡编写和红队测试,但各团队之间的实践并不一致;监督是临时性的;NIST 人工智能风险管理框架和《欧盟人工智能法案》这样的框架虽然为人所知,却只被部分采纳。
  3. 标准化阶段。 治理已被记录下来,并在全组织范围内得到执行:系统被对照公认的框架和 ISO/IEC 42001 进行映射,每个系统都有一个风险等级和一位指定的负责人,公平性、安全性和隐私测试、模型卡和数据卡、申诉渠道,以及针对高风险系统的红队测试,都是强制要求而非可选项。
  4. 管理阶段。 这项工作依据数据被度量和控制:子群体公平性指标、安全和”越狱”方面的发现、申诉数量和推翻率、监督否决率,以及工作负载足迹,都对照基准和阈值持续被追踪;漂移和结果差异会触发明确的行动;是否继续推进的决定,建立在证据之上,而不是靠信心保证。
  5. 编排阶段。 负责任的 AI 被持续改进,并在整个组织范围内被整合:对公平性、安全性和误用的监控在生产环境中运行,治理被内建于交付流程之中,环境成本是模型选择的一项正式输入,组织会随着法律、风险和能力的变化而调整其管控措施,责任由每一个人共同承担,而不是由单一一个团队承担。

讨论想法

  • 哪种公平性定义适用于某个特定的决策?由谁来决定?
  • 为了公平性或可理解性,牺牲多少准确率或性能是可以接受的?
  • 是什么让人类的监督具有实质意义,而不只是走个过场?
  • 针对自动化决策的申诉流程,应该如何设计才能做到公平和及时?
  • 你们如何针对那些你们尚未设想到的误用方式进行红队测试?
  • 环境成本是否应该影响模型选择?你们会如何权衡它?

关键要点

  • 值得信赖的 AI,在设计上就是公平、可解释、可问责、安全,并尊重隐私的。
  • 公平性和安全性是持续进行的度量和管理工作,而不是一次性的检查。
  • 让治理与 NIST 人工智能风险管理框架、《欧盟人工智能法案》和 ISO/IEC 42001 保持一致,以确保可辩护性和可审计性。
  • 保持实质性的人类监督、清晰的问责,以及真正的申诉权利。
  • 把隐私保护和防范误用融入工程设计,并考量环境成本。

参考文献与延伸阅读

  • National Institute of Standards and Technology, AI Risk Management Framework (AI RMF 1.0).
  • European Union, Artificial Intelligence Act (Regulation on Artificial Intelligence).
  • ISO/IEC 42001, Information technology, Artificial intelligence, Management system.
  • Solon Barocas, Moritz Hardt, and Arvind Narayanan, Fairness and Machine Learning: Limitations and Opportunities.
  • Christoph Molnar, Interpretable Machine Learning.
  • Cathy O’Neil, Weapons of Math Destruction.
  • Emma Strubell, Ananya Ganesh, and Andrew McCallum, Energy and Policy Considerations for Deep Learning in NLP.