7.4 产品分析与实验
概述与动机
产品分析是通过捕获和分析用户行为来理解人们实际如何使用一款产品的实践:他们触碰了哪些功能,在哪里获得成功,在哪里流失,以及是什么让他们不断回来。实验则是一门通过运行受控试验来确立因果关系的学科,最常见的形式是 A/B 测试(对两个变体进行随机化的正面比较),这样你就能依据真实影响,而不是依据看法或直觉,来判断产品变更的好坏。两者结合,让产品决策从”我们认为”走向”我们知道”,或者至少走向”我们测量过了”。
对于大型团队而言,这些实践具有决定性意义。当数十个小队向一款拥有数百万用户的产品交付变更时,没有指引的直觉会产生一连串没人能衡量其净影响的变更,本该由数据来裁决的争论,最终却由声音最大的人赢下。企业利用实验在规模化场景下保护营收和转化率,在全面上线之前就捕捉到有害的变更。政府数字服务也越来越多地采用同样的方法,来提升基本公共服务(福利申请、报税、证照续期)的采纳率和完成率,而在这些场景中,完成率上的一个微小提升,会转化为公民层面结果的巨大改善,并减轻呼叫中心的负担。
产品分析的价值完全取决于埋点质量和分析的严谨程度。草率的事件跟踪会产出没人信任的数据。做得不严谨的实验会产出自信满满却错误的结论。而且因为这类数据是行为性的、往往还是个人性的,你必须以一种尊重隐私、注重同意的方式来收集它,这在许多司法辖区是法律要求,在任何地方都是一种道德义务。本章涵盖埋点、核心的行为分析方法、严谨的实验、选择真正重要的指标,以及以负责任的方式完成这一切。
关键原则
- 依据一份有文档记录的跟踪计划和统一的分类法,有意识地进行埋点。
- 对于因果性问题,优先选择受控实验,而不是看法。
- 统计上的严谨性没有商量的余地;功效不足或提前偷看的测试会误导决策。
- 锚定在一个与真实价值挂钩的北极星指标上,而不是虚荣数字。
- 衡量留存率和参与度,而不仅仅是获客量。
- 只收集所需要的最少行为数据,并附有明确的同意。
- 把埋点当作一款产品来对待,配有负责人和质量检查。
- 一个负面或持平的实验结果是一项有价值的发现,而不是一次失败。
建议
依据跟踪计划和分类法进行埋点
在添加事件之前,先设计一份跟踪计划:你将捕获哪些事件、它们的属性、命名规范,以及每个事件回答了什么问题。强制执行一套统一的分类法(一套稳定的事件和属性命名方案),让数据能够跨团队、跨时间保持可分析性。把跟踪计划当作受治理的模式(schema)来对待:为它设定版本,评审变更,并依据它来校验事件,这样你就能在数据摄取时就捕捉到格式错误或意外的事件,而不是几个月后才发现数据中有缺口。没有这种纪律,产品数据就会变成一堆无法使用的、不一致的、重复的、未被记录的事件。
分析漏斗、群组、留存率和参与度
用漏斗(funnel)来查看用户在关键流程中的哪一步流失,从而有针对性地改进。用群组分析(cohort analysis)来比较按加入时间或行为定义的不同群体,这能揭示出变更是否真的随着时间的推移改善了行为。衡量留存率(用户是否会回来),因为没有留存的获客就像一只漏水的桶。诚实地刻画参与度,用有意义的方式定义什么是活跃用户,而不是用能粉饰太平的计数方式。这些建立在干净埋点基础上的分析,会告诉你产品中真正在发生什么。
运行严谨的实验
对于因果性问题,运行受控实验:把用户随机分配到不同的变体,并比较结果。严谨性需要多项纪律的支撑。在开始之前,计算出获得足够统计功效所需的样本量和持续时间。不要因为一个结果看起来显著就提前停止:提前偷看会抬高假阳性率。预先确定你的主要指标和假设,这样你就能避免在众多指标中翻找任何一个显著的结果。检查随机化是否稳健,并确认护栏指标(性能、营收、投诉)没有受到损害。使用一个实验平台来标准化分配、分析和护栏机制,这样每个团队运行的都是可靠的测试,而不是各自蹩脚地重新发明统计学。
选择一个北极星指标,避免虚荣指标
选定一个单一的北极星指标,用来捕捉你的产品为用户交付的核心价值,让它在增长时代表着真正的成功,而不是一个能上升却不对应真实价值的虚荣数字。注册用户总数、原始页面浏览量和累计下载量是典型的虚荣指标:它们只会上升,却很少反映健康状况。优先选择与被交付并留存的价值挂钩的指标,并围绕这个北极星指标配置一小组团队真正能够影响的输入指标。要警惕对一个代理指标的优化太过用力,以至于损害了真正的目标。
尊重隐私与同意
行为数据是个人数据。只收集为某个明确目的所需的数据,按法律要求获取并遵守用户的同意,并给予用户透明度和控制权。在足够的情况下,优先使用聚合和假名化的分析,尽量减少保留时间,并对其应用与任何敏感数据集相同的治理、分类和访问控制。尊重隐私所带来的意义,不止是满足像《通用数据保护条例》(GDPR)(欧盟的通用数据保护条例)之类的监管制度:它维系着产品所依赖的用户信任。要把分析设计成这样:一个拒绝被跟踪的用户,依然能获得一个可正常使用的产品。
把埋点和实验当作产品来对待
为埋点指定一位负责其质量、覆盖面和文档的负责人,并像监控流水线一样监控失效或缺失的事件。构建一种实验文化,配有一个共享平台、对实验设计的评审,以及一个历史结果的知识库,让组织能够累积地学习,而不是重复实验、忘记结论。
权衡取舍:利与弊
| 选择 | 优点 | 缺点 | 最适合场景 |
|---|---|---|---|
| 重度埋点 | 丰富的行为洞察 | 成本高,隐私暴露,噪声多 | 数据驱动型产品 |
| 最小化埋点 | 成本低,隐私风险低 | 存在盲点,分析薄弱 | 早期或低风险产品 |
| A/B 实验 | 因果确定性,保护指标 | 需要流量、时间和严谨性 | 高流量产品 |
| 直接上线并观察 | 快速,无流量门槛 | 存在混杂因素,无法证明因果 | 低流量或可逆的变更 |
| 聚焦北极星指标 | 一致性,优先级清晰 | 过度简化,存在被操纵的风险 | 大多数产品团队 |
| 众多 KPI | 更细致入微 | 焦点分散,目标相互冲突 | 成熟的分析型组织 |
核心的权衡是速度与确定性之间的取舍,而流量是调解两者的变量。实验能带来因果确定性,但需要足够的用户和足够的耐心才能达到统计功效。对于低流量的功能或明显可逆的变更,有纪律的”直接上线并观察”可能更为务实。埋点是用洞察力换取成本和隐私暴露,因此要有目的地收集,而不是囤积数据。而北极星指标则是用细致入微换取一致性:对聚焦很有力量,一旦被操纵就很危险,因此要配以护栏机制。
与团队讨论的问题
谁拥有你们的跟踪计划,你们是否在数据摄取时就依据它校验事件,让格式错误的数据快速失败,而不是几个月后才作为缺口浮现出来? 本章把跟踪计划当作受治理的模式(schema)来对待:有版本、经过评审、经过校验,并配有统一的分类法,让数据能够跨团队、跨时间保持可分析性。没有这种纪律,产品数据就会退化成一堆无法使用的、不一致的、重复的、未被记录的事件,而你只有在试图回答某个问题时才会发现这些漏洞。对于一款被数十个小队和数百万用户触及的产品来说,一份无人拥有的跟踪计划意味着每个团队对事件的命名方式各不相同,任何跨团队的分析都站不住脚。拿出证据:挑一个关键漏斗,检查它的事件是否被记录并被统一命名。如果所有权不明确,指定一个负责人,并像监控流水线一样监控失效或缺失的事件。
你们所有团队是否都通过一个共享平台来运行实验,配有功效计算和护栏机制,还是各自蹩脚地重新发明统计学? 本章明确指出严谨性没有商量的余地:在开始之前计算出获得足够统计功效所需的样本量和持续时间,预先确定主要指标和假设,不要提前偷看并停止,并留意性能、营收和投诉之类的护栏指标。一个共享的实验平台会标准化分配、分析和护栏机制,这样每个团队运行的都是可靠的测试,而不是每个小队各自偷看,直到某个结果看起来显著为止。对于高流量的企业产品而言,一次被阻止的糟糕上线(一次悄悄损害了留存率的重新设计)往往就能抵得上整个项目的成本。拿出一个信号:团队目前是在计算功效,还是在结果看起来不错时就停止?如果是后者,一个通用平台和设计评审就是解决方案。
对于一个拒绝被跟踪的用户,你们的产品是否依然能正常运作,你们是否只为某个明确的目的收集最少的行为数据? 本章把行为数据当作个人数据来对待:只收集某个明确目的所需要的数据,按法律要求获取并遵守用户的同意,尽量减少保留时间,并应用与任何敏感数据集相同的分类和访问控制。尊重这一点,维系着产品所依赖的用户信任,而在 GDPR 及类似制度下,这是一项法律要求,而不是一种礼貌。与之相竞争的压力是那种想要进行重度埋点以获取更丰富洞察的冲动,而这会提高成本、噪声和隐私暴露。拿出证据:列出你们收集的内容,把每个事件与它回答的问题关联起来,然后检查拒绝被跟踪是否依然能得到一个可正常使用的产品。如果某些收集行为没有目的,或者破坏了用户体验,就把它砍掉,并把分析设计成能为选择退出的用户优雅降级。
哪一个单一的北极星指标能够捕捉你产品交付的价值,你们如何防止团队把这个代理指标操纵到损害真正目标的地步? 一个北极星指标能让众多团队在同一个成功定义上保持一致,然而本章警告说,一个被过度优化的代理指标可能会损害它本应代表的目标,而注册用户总数或累计下载量之类的虚荣数字只会一路攀升,却不反映健康状况。对于一个有数十个小队各自追逐自己目标的大型组织而言,一个不清晰或容易被操纵的北极星指标,会产生一堆局部性的胜利,加起来却没有任何真正的改善,甚至更糟,造成没人察觉的悄然损害。拿出当前的北极星候选指标、团队真正能够影响的一小组输入指标,以及能够捕捉到操纵行为的护栏机制,然后对每一个上报的指标做压力测试,问它是否可能在用户处境变差的同时依然上升。在企业和政府场景中,一个头条指标可能会驱动预算和公开报告,因此要把北极星指标与一个”已留存价值”或”已完成结果”的定义绑定,这样就没人能靠追逐从未转化的注册量或点击量来虚增它。
对于低流量的功能,有纪律的”直接上线并观察”和一次完整的受控实验之间,诚实的分界线在哪里,由谁来决定? 实验能带来因果确定性,但需要足够的用户和足够的耐心才能达到统计功效,在一个流量稀薄的流程上强行进行一次功效不足的测试,会耗费数周时间,却产出一个无法检测出其所寻找效应的结果。与之相竞争的风险是,“直接上线并观察”存在混杂因素,无法证明任何因果关系,因此把它当作等同于实验来对待,会让团队宣称赢得了实际上只是季节性因素或同时发生的其他变更所导致的胜利。拿出该流程的流量和转化量、你所关心的最小可检测效应,以及该变更的可逆性,然后就一条规则达成一致:流量高于某个阈值就做实验,低于阈值则以清晰的护栏机制进行”直接上线并观察”。对于保护营收的企业产品和一次回归会损害公民利益的政府服务而言,要明确谁有权豁免一次实验,并要求可逆的变更真正保持可逆,这样一次糟糕的”直接上线并观察”就能被迅速撤回。
你们是否把负面和持平的实验结果记录进一个共享的知识库,还是组织在不断重新发现同样的死胡同? 本章明确指出,一个持平或负面的结果是一项有价值的证据,而不是一次失败,然而如果没有一个可检索的结果知识库,这个教训就会蒸发,另一个团队一年后又会重新运行同一个失败的测试。对一个大型组织而言,这种代价会不断累积,因为累积性的学习正是实验文化的全部回报所在,而这种回报只有在实验设计和结果被写下来、并且能被下一个团队找到时才会积累。拿出上个季度运行的实验数量、有多少结果被记录并可被发现,以及是否真的有人在设计新测试之前查阅过这个知识库。在企业和政府场景中,一份持久的记录同时也服务于审计和问责,它能证明一个决定建立在证据之上而不是看法之上,并在一项面向公众的变更受到质疑时,为评审人员提供一条站得住脚的轨迹。
行业视角
初创企业。 在添加任何其他东西之前,先为你的激活和首次会话事件写一份一页纸的跟踪计划,这样最早的数据才能在团队成长的过程中保持干净。把真正的 A/B 测试留给你流量最高的那个流程,在其他地方谨慎地采用”直接上线并观察”,购买一个托管的分析与实验工具,而不是自己构建一个,并坚持只用一个北极星指标,比如激活率。只收集能回答一个现存问题的事件,这样你就不会为从未被读取过的数据付出存储成本或隐私风险。
小型企业。 没有专职分析师、预算又紧张的情况下,依靠你已经在使用的工具中内置的分析功能,把实验当作一项偶尔进行的、高价值的活动,而不是一个常设项目。通常的选择是购买而非自建:一个内嵌的漏斗和群组视图,胜过一条你无法维护的定制化流水线。把你运行的少数几个测试聚焦在那个驱动营收的流程上,并以简单诚实的方式处理同意,让拒绝被跟踪的客户依然能获得一个可正常使用的产品。
企业。 在跨众多团队的规模化场景中,治理才是问题所在:一份在数据摄取时经过校验的、有版本的跟踪计划,一个能标准化分配、功效计算和护栏机制的共享实验平台,以及一个结果知识库,让各个小队能够累积地学习,而不是重复实验。为埋点指定一位像监控流水线一样被监控的负责人,就一个由可影响的输入指标围绕的北极星指标达成一致,并对行为数据应用与任何敏感数据集相同的数据分类和访问控制,为重大的上线决定保留审计轨迹。
政府。 采购规则、透明度和公共问责塑造着每一个选择。只为某个明确的目的收集最少的行为数据,获取并遵守用户的同意,并用通俗易懂的语言公开你跟踪了什么、为什么要跟踪,让拒绝的人依然能获得一个可正常使用的服务。对表单措辞和布局进行受控实验,以提升基本公共服务的完成率,为每次测试保留一份有文档记录的、可供审计的、站得住脚的记录,并要求任何分析服务供应商披露其数据处理方式,并给予数据可携带性,让你避免被锁定在某一供应商上。
案例
初创企业。 一款小型消费者应用在添加任何新的分析功能之前,先为其注册和首次会话事件写了一份简短的、有文档记录的跟踪计划,这样数据在团队成长的过程中始终保持干净。一个漏斗分析显示,大多数新用户在账户验证这一步流失了,一次针对更清晰措辞的简单 A/B 测试提升了首周留存率。由于流量适中,团队只在自己流量最高的流程上运行实验,对较小的变更则谨慎地采用”直接上线并观察”,同时把激活率作为北极星指标。
企业。 一家订阅制流媒体服务对一份受治理的跟踪计划进行埋点,并让每一个重大变更都经过一个实验平台,配有预先定义的指标、功效计算,以及针对播放性能和流失率的护栏机制。一次重新设计的引导流程在评审中看起来更好,但一次受控测试显示它降低了首周留存率,于是团队在大规模上线之前将其撤回,这次挽救的价值远远超过了该平台本身的成本。
政府。 一家数字服务机构以一份尊重隐私、注重同意的跟踪计划,为其福利申请流程进行埋点,并对表单措辞和布局运行受控实验。一次漏斗分析揭示出,有三分之一的申请人在某个特定步骤放弃了申请。一次针对更清晰指引的实验显著提高了完成率,同时减少了不完整申请和呼叫中心的话务量,而整个过程只收集了所需要的最少行为数据。
商业案例:动机、投资回报率与总拥有成本
产品分析与实验的投资回报直接体现在结果之中:更高的转化率、留存率和完成率,以及至关重要的一点()避免了交付有害变更的成本。实验是少数几种能够量化自身价值的实践之一,因为每一次测试都会报告它所带来的提升,或者它所阻止的损失。良好的埋点通过用证据取代猜测,成倍放大了每一次产品决策的回报,而一个北极星指标能让众多团队在同一个成功定义上保持一致。
采纳成本包括分析和实验工具、把埋点做好所需的工程投入、严谨运行测试所需要的分析技能,以及用于同意管理的隐私项目开销。要把它与不采纳的代价加以权衡:交付效果未知的变更、靠资历而不是证据赢得争论、追逐那些能粉饰太平却掩盖产品停滞的虚荣指标,以及因草率的数据收集而带来的监管风险。向领导层证明这一点时,可以说实验把产品开发变成了一个可衡量、能自我纠正的过程,而第一次被阻止的糟糕上线,往往就能抵得上整个项目的成本。
反模式与陷阱
- 在没有跟踪计划的情况下添加事件,产出不一致、无法使用的数据。
- 偷看实验结果,一旦看起来显著就停止,抬高假阳性率。
- 测试众多指标,庆祝其中随机显现出显著性的那一个。
- 运行功效不足、无法检测出其所寻找效应的测试。
- 优化那些能上升却不反映真实价值的虚荣指标。
- 把一个代理指标操纵得太过用力,以至于损害了真正的目标。
- 在没有同意或没有明确目的的情况下囤积行为数据。
- 忘记记录负面结果,导致组织重复运行失败的测试。
成熟度模型
- 启动。 埋点稀疏或不一致,决策由看法和资历决定,没有运行任何实验,注册总数之类的虚荣指标被上报。同意处理得很草率。
- 发展。 一些事件被跟踪,但分类法在各团队之间出现漂移。偶尔运行一些没有做功效计算的临时 A/B 测试,漏斗和留存率被非正式地查看,一个北极星指标已被提出,但尚未真正落地。
- 标准化。 一份受治理的跟踪计划和统一的分类法被记录下来,有版本,并在每个团队的数据摄取环节都经过校验。漏斗、群组和留存率被常态化地分析,实验在一个共享平台上运行,配有预先定义的指标、功效计算和护栏机制,隐私和同意在全组织范围内被妥善处理。
- 管理。 这项实践依据基线被度量:埋点覆盖率和事件质量的错误率被跟踪,实验的速度以及有多少比例的上线受到测试把关被上报,护栏指标的突破和偷看行为被自动捕捉,北极星指标及其输入指标被监控,配有明确的终止阈值。数据质量和隐私合规按固定节奏被审计,而不是被想当然地假定。
- 协同。 实验成为每一次重大变更的默认做法,埋点像流水线一样被拥有和监控,一个包含负面和持平结果的共享结果知识库,让组织能够累积地学习、淘汰死胡同。分析与产品和风险规划整合在一起,从设计上就尊重隐私,指标体系随着产品、市场和监管的变化而持续被重新界定。
讨论思路
- 你们产品真正的北极星指标是什么,所有人都对它达成一致了吗?
- 你们上报的指标中,哪些是只会一路上升的虚荣数字?
- 你们的团队在运行实验之前会计算统计功效吗,还是会偷看并提前停止?
- 你们的埋点在哪些地方存在掩盖用户痛点的盲点?
- 你们如何在保持分析尊重隐私的同时,依然能了解到你们需要知道的东西?
- 对于低流量的功能,什么时候”直接上线并观察”是可以接受的,什么时候需要一次完整的实验?
关键要点
- 依据一份受治理的跟踪计划和统一的分类法,有意识地进行埋点。
- 分析漏斗、群组、留存率和参与度,而不仅仅是获客量。
- 运行严谨的实验:功效计算、预先定义的指标、不偷看。
- 锚定在一个与真实价值挂钩的北极星指标上,并防范虚荣指标。
- 在明确的同意和强有力的治理下,收集最少的行为数据。
- 把埋点当作一款产品来对待,并构建一种累积性的实验文化。
- 一个持平或负面的实验结果是一项有价值的证据,而不是一次失败。
参考文献与延伸阅读
- Ron Kohavi, Diane Tang, and Ya Xu, “Trustworthy Online Controlled Experiments.”
- Alistair Croll and Benjamin Yoskovitz, “Lean Analytics.”
- Eric Ries, “The Lean Startup.”
- Avinash Kaushik, “Web Analytics 2.0.”
- Georgi Georgiev, “Statistical Methods in Online A/B Testing.”
- Regulation (EU) 2016/679, General Data Protection Regulation (GDPR).
- Douglas W. Hubbard, “How to Measure Anything.”