7.5

View in English

7.5 决策科学与数据知情文化

概述与动机

决策科学是一种将数据与实际决策连接起来的实践,它借助统计学、行为科学和判断力,帮助人们在不确定性下做出良好的选择。数据知情文化是一种组织状态,在这种状态下,上述做法会默认发生:人们会主动寻求证据,认真推理因果关系,诚实地传达不确定性,并在数据证明有必要时更新自己的信念。本章有意作为数据系列内容的压轴章节,因为如果之前所有的战略、工程、分析和实验都没能让决策变得更好,它们就毫无价值。

对于大型团队而言,数据投资最常在这里失败()不是败在数据管道上,而是败在从洞察到行动的”最后一公里”上。企业在平台和仪表盘上投入巨资,却仍然依靠层级、习惯或最自信的陈述者来做出重大决策。一种常见的失败模式是”数据剧场”:精心制作的仪表盘和分析显得十分严谨,但实际决策早已提前做出,数据只是被挑选出来为其提供依据。在政府领域,风险和审视力度都更高。以薄弱的因果主张为依据的政策决策,可能会错误分配公共资金并伤害公民,而问责制的要求,使得对证据进行诚实推理不仅是良好实践,更是一项公民义务。

这里真正棘手的问题属于认知和文化层面,而非技术层面。人们常常将 相关性与因果关系 混为一谈,忽视 混杂因素(同时驱动所谓原因和结果的隐藏变量),锚定在自己看到的第一个数字上,并把点估计当作确定无疑的事实来解读。而在追求数据驱动的过程中,组织也可能滑向监控:对个人进行如此侵入式的度量,以至于摧毁信任、引发博弈行为。建立真正的度量文化,意味着把推理做对、诚实传达不确定性,并对系统和结果进行度量,而不是把数据变成控制人的工具。

核心原则

  • 数据的目的是做出更好的决策,而不是生产报告。
  • 在查看数据之前,先确定什么样的结果会改变你的想法。
  • 相关性不等于因果关系;在采取行动之前,先审视混杂因素。
  • 诚实地传达不确定性;没有区间的点估计具有误导性。
  • 要做到数据知情,而不是被数据奴役;判断力和背景信息依然重要。
  • 度量是为了学习和改进系统,而不是为了监控和惩罚个人。
  • 当证据充分时更新信念;改变想法是一种优点,而非弱点。
  • 心理安全感 是诚实分析与提出异议的前提条件。

建议

将数据与决策相连接,避免数据剧场

从一开始就将分析与某个具体决策绑定:根据不同的发现,我们会采取哪些不同的做法?在收集数据之前,先明确决策本身、各个备选方案,以及什么样的证据会支持每个方案()理想情况下,还要明确什么样的结果会改变你的想法。这样可以防止出现”数据剧场”,即分析只是在为已经做出的决策做装饰。如果没有任何现实的发现能够改变这个选择,就不要在分析上花费精力,而应诚实地做出判断,并如实说明这一点。要坚持让汇报以决策和建议开头,而不是先展示一连串图表。

谨慎地推理因果关系

大多数商业和政策问题都是因果性问题(这个行动会不会产生这个结果),但可获得的大多数数据都是观测性数据,充满了混杂因素。教会团队区分相关性与因果关系,以及各种陷阱:混杂变量、选择偏差、反向因果关系和虚假相关性。在可行的情况下,优先使用随机实验来支持因果主张。在无法进行实验的情况下,使用严谨的 因果推断 技术,明确说明你的假设,而不是悄悄地从”与……相关”滑向”导致……”。对建立在单一相关性之上的动人故事,尤其要保持怀疑。

向利益相关者传达不确定性

以精确点估计形式呈现的数字,容易带来虚假的确定感。要传达区间、置信区间或可信区间,以及任何数字背后的关键假设。使用平实的语言和诚实的可视化方式(误差线、区间、情景带),让决策者理解哪些是已知的、哪些是未知的。要区分数据本身显示了什么、你推断出了什么,以及你假设了什么。让信心程度与证据相匹配:如果预测建立在薄弱的数据之上,就如实将其呈现为一个基于薄弱数据的预测。诚实传达的不确定性,比虚假的精确性更能建立信任,因为它经得起现实的检验。

建立不依赖监控的度量文化

营造一种环境,让团队能够常态化地定义成功指标、度量结果并从中学习,但要将度量的目标对准系统、流程和结果,而不是对个人进行监控。用于监控和给人排名的指标会被博弈,滋生恐惧,并摧毁良好决策所需要的诚实(古德哈特定律 所描述的正是这种现象:一旦某个度量指标变成了目标,它就不再是一个好的度量指标)。优先采用面向结果的聚合指标。让团队参与选择自己的度量指标,并将学习性指标与绩效考核区分开来。保护心理安全感,让人们能够及早提出坏消息和不同意见。

培养健康的数据习惯与数据素养

广泛提升数据素养,使人们能够批判性地解读图表、质疑指标的定义,并识别出具有误导性的说法。让”我们是怎么知道这一点的?“和”什么会改变我们的想法?“这类提问成为常态。奖励那些根据证据更新观点的人,以及那些即便实验失败、却能带来有价值信息的人。让人们能够安全地说出”数据无法告诉我们答案”,而不是人为制造确定感。领导者定下基调:当他们根据证据改变决策、承认不确定性时,整个文化就会随之而来。

防范偏差与误用

警惕那些可预见的偏差:在挑选支持性数据时出现的 确认偏差、在忽视缺失数据时出现的 幸存者偏差、锚定在最初看到的数字上,以及在事后总结中出现的后见之明偏差。在重要分析中引入”魔鬼代言人”式评审、对预期发现进行预注册,以及纳入多元视角。认真对待数据伦理(公平性、透明度以及避免伤害),尤其是在决策会影响到人们的生计、福利或权利时。

权衡取舍:优点与缺点

选择优点缺点最适场景
数据驱动(由数据决定)减少偏见、结果一致忽视背景、易被博弈、脆弱已被充分理解的领域
数据知情(数据加判断)兼顾证据与背景速度较慢、需要判断力复杂或新颖的决策
通过实验验证因果关系因果证据有力成本高、速度慢、并非总是可行高风险但可逆的选择
观测性推断利用现有数据存在混杂风险、结论较弱无法开展实验时
结果/系统指标推动改进、不易被博弈个人问责性较弱学习型文化
个人监控具备细粒度可见性引发博弈、恐惧、信任受损很少能站得住脚

这里的核心张力在于严谨性与速度、可行性之间的取舍。随机实验能够提供最有力的因果证据,但需要耗费时间,而且对于一次性的战略或政策决策而言,往往根本无法开展实验,这时就必须依靠对混杂因素的审慎判断和明确的假设来支撑。第二重张力存在于度量与信任之间:你对个人的度量越细致,能看到的东西就越多,得到的诚实行为就越少。成熟的文化更倾向于采用数据知情的判断,以及面向结果的聚合式度量。它接受略微降低表面上的精确度,以换取经得起检验的决策,以及一支愿意说真话的员工队伍。

与团队讨论的问题

  1. 你是否会在查看数据之前,先说明什么样的结果会改变你的想法,这个问题是否写入了你们的决策文档? 本章对抗”数据剧场”最有力的手段,就是在收集数据之前,先明确决策本身、各个备选方案,以及支持每个方案的证据()理想情况下,还要明确哪种结果会让你的选择发生逆转。如果没有任何现实的发现能够改变这个决策,那么诚实的做法就是跳过分析,公开地做出判断。对于企业和政府机构而言,一个错误的战略或政策选择所造成的浪费,往往可能超过整个分析项目的成本,因此这项纪律具有很高的杠杆效应。找出一个最近做出的决策,问问自己:是否存在任何发现能够改变这个决策,还是说那些图表只是在为一个早已得出的结论做装饰?如果”什么会改变我们的想法?“这个问题还不是你们决策文档中的标准环节,那就把它变成标准环节,并坚持让汇报以建议开头,而不是先展示一连串图表。

  2. 当出现一个引人注目的相关性时,你会如何在采取行动之前审视混杂因素?在可行的情况下,你是否倾向于开展实验? 本章警告说,大多数商业和政策问题都是因果性问题,而可获得的大多数数据却是观测性数据,充满了混杂因素、选择偏差和反向因果关系。书中反复出现的一个陷阱是:参与度高的客户会自我选择去使用某项功能或参加某个项目,因此在受控比较之下,这种功能或项目与更低流失率或更高求职成功率之间的原始相关性就会消失。基于这种相关性采取行动,往往意味着一场代价高昂、方向错误的营销活动或政策举措。找出一个曾经仅仅依据单一相关性做出的决策,问问自己:什么隐藏变量可能同时驱动了相关性的两端?如果实验可行,就优先采用实验;如果不可行,就使用严谨的因果推断方法,明确说明你的假设,而不是悄悄地从”与……相关”滑向”导致……“。

  3. 你们的指标是致力于改进系统和结果,还是用于监控个人?你们是否已经将学习性指标与绩效考核区分开来? 本章划出了一条清晰的界限:指向个人的度量会被博弈、滋生恐惧,并摧毁良好决策所需要的诚实()这正是古德哈特定律所预言的动态,一旦某个指标变成了目标,就会出现这种情况。本章更倾向于面向结果的聚合指标,让团队参与选择自己的度量指标,并保护心理安全感,使人们能够及早提出坏消息。对于政府和企业环境而言,对一线员工的监控会侵蚀信任,而信任恰恰是准确数据得以产生的前提。提出这个具体问题:你们的哪些指标可能被用来给个人排名或加以惩罚?在压力之下,人们会不会去博弈这些指标?如果学习性指标和绩效考核纠缠在一起,就把它们分开,让度量推动改进,而不是催生防御性行为。

  4. 当一个数字传达给决策者时,它是以带有假设说明的区间形式出现,还是以容易带来虚假确定感的点估计形式出现? 本章认为,诚实传达的不确定性比虚假的精确性更能建立信任,因为它经得起现实的检验;然而,当领导者想要一个干净利落的答案时,给出单一自信数字的诱惑力是很强的。对于大型团队而言,这种相互对抗的压力是真实存在的:区间和误差线在崇尚果断的高管眼中可能显得含糊其辞,于是分析师就学会了剥离掉各种附加说明,好让自己的意见被听到。找出一份最近的报告,检查它是否区分了数据本身显示了什么、你推断出了什么,以及你假设了什么,检查建立在薄弱数据之上的预测是否被如实标注为如此。在企业和政府环境中,一个数字可能最终出现在董事会材料、预算提案或公开证词之中,因此把一个点估计当作确定无疑的事实来呈现是一种负债,应当约定一项统一标准:凡是有重大影响的数字,都必须附带区间、关键假设,以及对置信程度的清晰说明。

  5. 在你们这里,说出”数据无法告诉我们答案”是否真的安全?又是谁有权质疑一个指标的定义方式? 本章将数据素养和心理安全感视为前提条件:人们需要能够批判性地解读图表,能够问出”我们是怎么知道这一点的?“,并能够在不受惩罚的情况下承认不确定性,否则整个文化就会默认制造出虚假的确定感。对于大型组织而言,这里存在的张力是:广泛的数据素养需要真正的培训时间和预算,而质疑某位资深人士偏爱的指标,可能会让人感觉有损自己的职业发展,于是未经审视的数字就会一路畅通无阻地向上传递。找出证据,看看在场的人当中,究竟谁真正能够质疑一个指标的定义和来源,并回想一下上一次有人因为更新自己的观点,或者报告了一次有价值的失败而受到奖励、而非惩罚,是在什么时候。对于企业和政府机构而言,一个定义不清的度量指标可能会左右资金拨付或公开报告,因此要明确指出谁有资格质疑某个指标,并在他们这样做时予以保护。

  6. 你们如何保护重要分析不受可预见偏差的影响?你们是在决策之前就引入不同意见,还是等到决策之后? 本章列出了那些会悄悄腐蚀证据的陷阱:在挑选支持性数据时出现的确认偏差、在忽视缺失数据时出现的幸存者偏差、锚定在最初的数字上,以及在事后总结中出现的后见之明偏差。与此相竞争的考量是速度,因为”魔鬼代言人”式评审、对预期发现的预注册,以及纳入多元视角,都会拖慢决策速度,也是在截止日期压力下最先被砍掉的环节。找出一次最近的高风险分析,问问自己:如果当时有人被指派去论证相反的观点,会不会浮现出什么新的信息?团队在看到结果之前,是否写下了自己的预期?在企业、尤其是政府场景中,决策会影响到人们的生计、福利或权利,因此要把数据伦理和结构化的异议机制,当作重大分析中一项常设要求,而不是在繁忙的季度里可以悄悄砍掉的额外事项。

行业视角

初创企业。 由于没有分析师、每一次押注的资金只够支撑几周,你们的决策科学是一种习惯,而不是一个职能部门:在做出重大投入之前,问一问什么样的结果会改变你的想法,以及一次低成本的实验能否比一场会议更快地给出答案。要坚决防止把整个季度都押在一个亮眼却单薄的相关性上,因为一个规模很小的团队根本经不起路线图走错方向所带来的损失。保持轻量化,在决策文档里写下一行文字,说明什么信号会让你停下脚步,而不是搞一场你永远也不会真正执行的正式评审。

小型企业。 你们很可能没有专职的数据专家,而是在已经在用的工具里附带使用分析功能,因此风险在于:不加质疑地信任供应商提供的仪表盘,却不去追问某个指标是如何定义的,或者其对比方式是否公平。把你们有限的注意力花在推理上,而不是花在工具上:在真正能撬动业务的那一两个决策上,把相关性和因果关系区分清楚,并在投入一笔无法收回的资金之前,诚实地对自己说明其中的不确定区间。当某个工具提出可以自动化某项决策时,只要一次错误的判断就会让你失去一个客户,就要在这个环节保留人工把关。

企业。 在众多团队之间,问题在于一致性和治理:需要形成一种共同的预期,即分析工作要提前明确决策本身和终止标准,因果主张要说明其假设,具有重大影响的数字进入董事会材料和审计报告时要附带区间。在整个组织范围内,将学习性指标与绩效考核区分开来,避免度量演变成监控和博弈。投入资源提升广泛的数据素养,并推行”魔鬼代言人”评审和预注册等评审实践,使一个自信满满的陈述者无法在整个组织规模上以自信取代证据。

政府。 采购、透明度和公共问责制,提高了每一项因果主张的风险,因为一项以虚假相关性为依据的政策,可能会错误分配公共资金并伤害公民。在项目评估中,优先采用严谨的对比设计,向监督机构以带有明确假设的区间形式传达效果,并将推理过程记录下来,以便审计能够加以追溯。将度量的目标对准项目结果,而不是对一线工作人员进行监控,并向公众清楚说明证据是如何影响这项决策的。

案例

初创企业。 一家尚处于 A 轮融资之前的初创公司注意到,加入其社区论坛的用户流失率要低得多,创始人们已经准备把整个产品路线图都押在论坛功能上。在做出承诺之前,其中一人问了一句:什么会改变我们的想法?快速调查后发现,那些本来就已经很忠诚的客户,恰恰就是那些愿意花时间加入论坛的人。他们没有把整个季度都押在一个相关性上,而是开展了一次小规模实验,并把”什么会改变我们的想法?“变成了决策文档中的一个标准问题。

企业。 一家金融服务公司注意到,使用某项特定功能的客户流失率要低得多,公司几乎已经启动了一场代价高昂的营销活动,要把所有客户都推向这项功能。一次决策科学评审指出了其中明显的混杂因素:本来就参与度更高的客户,会自我选择去使用这项功能。随后进行的一次受控实验表明,这项功能本身对流失率几乎没有因果影响。这家公司避免了一笔方向错误的巨额投资,管理层也在每次重大支出之前,将”什么会改变我们的想法?“确立为一个标准问题。

政府。 一家负责评估某项就业项目的公共机构,没有仅凭”参与者找到工作的比例很高”这一原始统计数字就宣称项目取得成功,因为他们意识到,本来就有较强积极性的人,往往会自我选择去参加这类项目。该机构采用了严谨的对比设计,并以带有明确假设的区间形式,向监督机构传达了估计效果。度量工作聚焦于项目结果,而不是对一线工作人员进行监控,这既维护了一线员工的信任,又依然能够推动问责和改进。

商业论证:动机、投资回报率与总拥有成本

决策科学的投资回报体现在:避免了那些自信满满却错误的决策所带来的成本,并提升了一个组织成千上万次决策的质量。一个仅凭虚假相关性为依据的重大战略或政策选择,所造成的浪费可能远远超过建立良好决策实践的全部成本。更好的校准能力(清楚知道自己知道什么、不知道什么),能让你恰当地衡量押注的大小,既避免鲁莽的承诺,也避免陷入瘫痪。从整体上看,数据知情的文化会产生复利效应:每个团队都把决策做得稍微好一点、推理得更充分一点,就能带来巨大的杠杆效应。

推行这种文化的成本主要体现在文化和教育层面:数据素养培训、用于细致分析和评审的时间,以及领导层愿意改变决策、承认不确定性的意愿。相比前面各章所讨论的平台,这在金钱上的花费要低得多,但推行起来却更加困难,因为它要求掌握权力的人也要受到证据的约束。要把这种成本,与不采用这种做法的成本加以权衡:白白浪费分析精力的数据剧场、由最自信的声音主导的决策、一接触现实就站不住脚的因果主张,以及一旦监控扎下根来,就会出现博弈指标、隐瞒坏消息的员工队伍。对于领导层而言,这个道理很简单:此前所有的数据投资,只有在从洞察到决策的最后一公里走得稳健时才能真正回本,而决策科学正是这最后一公里。

反模式与陷阱

  • 数据剧场:为已经做出的决策制作分析,用以自圆其说。
  • 在没有审视混杂因素的情况下,悄悄从”与……相关”滑向”导致……“。
  • 把点估计当作确定无疑的事实来呈现,掩盖了其中的不确定区间。
  • 确认偏差:只寻找能够支持自己偏好结论的数据。
  • HiPPO 式决策:薪酬最高者的意见凌驾于证据之上。
  • 把指标变成对个人的监控手段,引发博弈行为和恐惧心理。
  • 古德哈特定律的现实体现:一个变成目标的指标,不再能度量真正重要的东西。
  • 因为一次有价值的失败而惩罚当事人,扼杀诚实和实验精神。

成熟度模型

  1. 启动级。 决策依靠层级和直觉运行,声音最大或最资深的人说了算。相关性被随意当作因果关系对待,不确定性被忽视,而少数使用中的指标则用于监控个人,并容易被博弈。
  2. 发展级。 一些团队开始参考数据,并意识到因果陷阱的存在,但分析工作常常带有选择性,是为已经做出的决策提供依据而制作的。不确定性很少被传达出来,各团队的度量实践也不一致。
  3. 标准化级。 组织记录并推行共同的实践:分析与某个明确命名的决策及预先设定的标准相绑定,各团队能够区分相关性与因果关系,并在支持因果主张时优先采用实验,数字都附带区间和明确说明的假设,度量的目标对准结果而非个人,心理安全感也得到保护。
  4. 管理级。 决策质量会与基线进行对照度量和控制。组织会追踪以下情况:有多少比例的分析在数据到来之前就明确了终止信号、有多少比例具有重大影响的数字在发布时附带了明确传达的区间、有多少因果主张建立在实验之上、而不是仅凭裸相关性,以及决策是否根据证据发生了逆转。预注册和”魔鬼代言人”评审等防偏差实践会接受审计,开始被博弈的指标也会被及时发现并淘汰。
  5. 协同级。 严谨的推理能力在整个组织范围内持续改进并加以整合。“什么会改变我们的想法?“成为任何重大决策前的常规环节,因果严谨性和诚实面对不确定性成为文化常态,领导者会明显地根据证据更新看法,并承认未知之处。度量在不依赖监控的情况下推动学习,决策实践随着组织及其风险的变化而不断调整,最终每一个层级都能做出更好的决策。

讨论议题

  • 在你的组织中,数据在哪些地方被用来为已经做出的决策做装饰?
  • 最近有哪个决策,是建立在一个可能并非因果关系的相关性之上的?
  • 你们的报告在传达不确定性方面有多诚实?又是谁在抵触使用区间?
  • 你们的指标是致力于改进系统,还是用于监控个人?
  • 上一次有领导者明显地因为数据而改变决策,是在什么时候?
  • 你们如何防止对度量的追求演变成监控?

关键要点

  • 数据的意义在于做出更好的决策;要警惕数据剧场。
  • 在查看数据之前,先说明什么会改变你的想法。
  • 切勿将相关性误认为因果关系;要审视混杂因素,并优先采用实验。
  • 诚实地传达不确定性;虚假的精确性一旦失效,就会摧毁信任。
  • 要做到数据知情,而不是被数据奴役;判断力和背景信息依然重要。
  • 度量系统和结果是为了学习,而不是为了监控个人。
  • 保护心理安全感,让人们能够更新信念,并提出坏消息。

参考资料与延伸阅读

  • Daniel Kahneman, “Thinking, Fast and Slow.”
  • Judea Pearl and Dana Mackenzie, “The Book of Why.”
  • Douglas W. Hubbard, “How to Measure Anything.”
  • Nate Silver, “The Signal and the Noise.”
  • Cathy O’Neil, “Weapons of Math Destruction.”
  • Darrell Huff, “How to Lie with Statistics.”
  • Philip Tetlock and Dan Gardner, “Superforecasting.”
  • Charles Wheelan, “Naked Statistics.”