5.8

查看英文版

5.8 设计研究与可用性测试

概述与动机

用户研究是一门了解你为之构建产品的人的学问:他们的目标、所处情境、任务,以及绊倒他们的障碍。其核心价值在于降低风险。软件领域最昂贵的错误不是一个缺陷或一次错过的截止日期,而是把一件错误的事情做得很好,然后在上线之后才发现没有人需要它,或者没有人能用得了它。研究能在你把工程投入到一个后来被证明是错误的方向之前,以低成本买下这份风险的下降。第 5.1 章打下了用户体验的基础,本章则深入探讨让这些基础保持诚实的两台引擎:告诉你该构建什么的生成式研究,以及告诉你所构建的东西是否真的有效的评估式研究。

对于大型团队而言,风险成倍增加。当许多小组向同一个产品发布功能时,每个小组每个冲刺都在对用户做出赌注,如果没有一种共享的研究习惯,这些赌注就只是披着自信外衣的意见。一小股稳定的证据流,让所有人都能基于同一份现实进行争论,于是争论会以”我们去看看几个用户怎么做”收场,而不是以谁资历最深、谁嗓门最大收场。研究成果也能流通:如果捕获和分享得当,一次运作良好的研究可以同时纠正十几个团队的假设。

企业和政府环境再次提高了门槛。企业软件常常拥有一群无法离开的被困用户,因此不可用的工具的代价,体现在错误、培训和浪费的工时上,而不是体现在你能在仪表盘上看到的流失率上。政府服务面向全体公众,包括处于危机中的人、使用旧手机的人、数字信心不足的人,或没有其他选择的人。正是出于这个原因,许多国家级数字服务标准如今强制要求用户研究,因为一份没人能填完的表格,会让人们无法获得他们本应享有的福利。在这里,研究不是可有可无的锦上添花,而是你信守公共承诺的方式。

关键原则

  • 研究降低了构建错误事物的风险;它在你构建之前是最便宜的,而不是在之后。
  • 生成式研究找到正确的问题;评估式研究检验解决方案。两者你都需要。
  • 观察人们实际做了什么,而不只是他们说了什么;表述出来的偏好与真实行为常常是背离的。
  • 定性方法解释”为什么”;定量方法衡量”有多少”。要把两者结合起来。
  • 小而持续胜过罕见而沉重。每周几个用户所学到的,胜过一年一次的大型研究。
  • 你的发现只有你的参与者所代表的那样具有代表性,所以要刻意招募,包括残障用户和难以触达的用户。
  • 只留存在某一个团队的幻灯片里的洞见等于丢失了。要把研究成果记录下来,让整个组织都能复用。
  • 偏见会通过引导性问题和一厢情愿的综合分析悄悄潜入;要有意识地设计出对抗它的机制。

建议

把生成式研究与评估式研究区分开来

要明确你在问的是哪一类问题,因为它们所用的方法是不同的。生成式(或称探索式)研究是开放式的,在你还没有解决方案时探索一个问题空间:人们实际上想要完成什么?当前体验的痛点在哪里?他们又是如何变通应对的?评估式研究则是针对一个具体任务测试一个具体设计:人们能完成它吗?他们会在哪里卡住?把两者混为一谈会浪费掉两者的价值。当你还不理解问题时就运行一场严格按脚本进行的可用性测试,会得到一个针对错误问题的漂亮答案;而当你需要验证一个结账流程时进行一场无结构的闲聊,只会让你继续猜测。先明确研究问题,再选择方法,并把生成式研究的发现输入到真正塑造路线图的产品探索环节(第 10.14 章)中。

让方法与问题相匹配

不存在万能的方法,只有合适与否。用户访谈能揭示动机、心智模型和历史,是你探索阶段的主力工具。情境访查,即观察人们在自己的环境中做真实的工作,能揭示出人们在会议室里从不会提及的变通做法和干扰因素。调查问卷能在大规模人群中衡量态度和频率,却无法解释背后的原因,而且对糟糕的问题设计惩罚极其严厉。卡片分类和树状测试从用户的心智模型中导出并验证信息架构:卡片分类让人们对概念进行分组和命名,而树状测试则检验他们能否在一个提议的结构中找到东西。日记研究能捕捉那些历经数天或数周才展开的行为,比如入职引导或习惯养成,这是任何单次会话都无法看到的。一个简单的经验法则:用访谈和情境访查来理解人,用卡片分类和树状测试来构建信息结构,用调查问卷和日记研究来跨越时间和规模进行观察,用可用性测试来检验一个设计。

尽早、频繁、小规模地开展可用性测试

可用性测试是单一杠杆效应最高的评估方法,你甚至可以在代码存在之前,用纸质草图就开始测试。一个广为人知的经验法则是,每轮大约五个用户就能发现大多数严重、明显的可用性问题,所以随着设计的演进运行三轮各五人的测试,要好过在最后进行一次十五人的大型研究。不过要理解这条经验法则的局限性。五个用户只在针对单一同质群体发现重大问题时才够用;它不能衡量成功率,不能覆盖不同的用户细分(每一个有意义的不同群体都需要自己的一小批参与者),也无法捕捉那些罕见但严重的问题。当你想深入探究推理过程、随机应变、处理复杂或敏感的任务时,选择有主持人的测试;当你想要速度、数量、地域覆盖范围,并为直接明了的流程降低成本时,选择无主持人的测试。大多数成熟的团队两者都用:用有主持人的测试来理解,用无主持人的测试来大规模确认。

编写不会诱导证人的任务和问题

你的研究的可信度取决于你的方案,而毁掉它最快的方式,就是提前暴露出你希望得到的答案。给参与者设定真实的目标,而不是操作指令:说”你刚搬了家,需要更新地址”,而不是”点击编辑资料按钮,修改你的地址”。询问过去的行为,而不是未来的意图,因为”你会使用这个吗?“往往只会得到出于礼貌的谎言,而”跟我说说你上一次这样做的经历”则能得到事实。避免那些预设了自身结论的问题,并对确认偏误()即人类倾向于注意并记住支持自己已有信念的证据的这种偏误()保持警惕。撰写该设计的研究人员,不应该在无形中把参与者引导向成功,而在场观察的团队应该先记录发生了什么,再去讨论它意味着什么。当你把任务的设计与沟通同产品本身的设计(第 5.4 章)分开时,你会得到更干净的信号。

招募真正能代表你用户的参与者

发现结果会继承你招募方式所带来的偏差。如果你只用自信、人脉广、对技术得心应手的志愿者来测试,你最终会发布出一款对那些本来就几乎不需要帮助的人来说好用得很、却让最需要帮助的人无法使用的产品。先定义你的用户细分,然后有针对性地按此招募,包括依赖辅助技术的残障用户(第 5.3 章),以及难以触达的群体,比如处于危机中的人、数字信心不足的人、老年用户,以及网络连接缓慢或使用旧设备的人。触达这些参与者需要付出更多努力,往往还需要与社区组织合作、提供适当的激励措施和灵活的后勤安排,但跳过这一步并不会让这些用户消失,只会把发现问题的时间点推迟到生产环境,那时候代价要高昂得多、危害也大得多。要仔细筛选,确保你招到的是某个细分群体的真实成员,而不是靠钻激励措施空子的职业测试者。

把发现综合成决策,而不仅仅是报告

原始观察本身并不是洞见。综合分析的工作,是把一堆会话记录变成团队可以采取行动的少数几项决策。亲和图法,即把单个观察聚类成主题(亲和图背后的做法),是让各场会话中的模式变得清晰可见的标准手法。对于以访谈为主的研究,一次轻量级的主题分析能让你如实判断哪些主题真正得到了数据的支持。把持久的模式汇入第 5.1 章提到的共享模型中()基于证据的用户画像和用户旅程图()这样洞见就能不断积累,而不是随时间蒸发消散。检验综合分析好坏的标准很简单:有没有一项决策因此改变?一份产出了精美幻灯片却没有改变任何路线图条目的研究,只是一场表演。每一次研究都应以一份简短的、按优先级排序的发现清单收尾,并为每一项给出建议的行动。

用分析数据和实验来对定性研究进行三角验证

定性研究和定量数据回答的是同一个问题的两个不同半边,各自都弥补了对方的盲区。研究能解释用户为什么会那样表现,但只能看到房间里那寥寥几个人;分析数据和实验(第 7.4 章)能看到整个人群,却无法解释动机,也无法捕捉到那些从未成为用户的人所遇到的问题。把它们当作一个循环来使用:分析数据展示出流失点,研究解释其原因,一次重新设计解决了它,一次实验则衡量修复是否真的改变了这个数字。当定性信号与定量信号相互矛盾时,把这种矛盾当作线索而不是麻烦来对待,因为通常是其中一方衡量到了你没有意识到自己在衡量的东西。两者谁也不是谁的上级;决策来自于把二者结合起来阅读。

建立研究运营体系,让研究能够规模化

一旦有超过两三个团队在做研究,瓶颈就不再是方法问题,而变成了后勤问题:招募、排期、知情同意、激励措施、笔记存储,以及在有人重新运行上季度的研究之前先把它找出来。研究运营(ResearchOps)就是让这套机器保持可靠运转的实践。要投入建设一个可搜索的洞见仓库,让发现的问题能被打上标签、被检索到、并在各团队之间复用;建立一个尊重知情同意、隐私以及联系人们频率的参与者管理系统;并建立一个规律的研究节奏,让研究成为一种稳定的习惯,而不是临时抱佛脚。让研究民主化,即允许非研究人员运行一些研究,这是值得做的,但必须有护栏:模板、培训和评审,这样你才能在扩大学习量的同时,不放大糟糕方案和带偏见结论的数量。

权衡:优点与缺点

方法最适用于优点缺点
用户访谈探索、动机深挖原因,灵活,起步成本低样本量小,容易受访谈者偏见影响
情境访查真实世界行为揭示变通做法和情境耗时长,难以排期
调查问卷大规模态度调查样本量大,可量化无法解释原因,很容易设计不当
卡片分类与树状测试信息架构让结构立足于心智模型范围狭窄,需要仔细分析
日记研究长期行为捕捉纵向模式流失率高,参与者负担重
有主持人的可用性测试理解一个设计可深入探究、可随机应变、内容丰富速度慢,成本高,占用主持人精力大
无主持人的可用性测试大规模确认快速、廉价、地域覆盖广无法追问,对复杂任务的挖掘较浅

核心张力在于深度与规模之间,解决办法是排序而非取舍。先用深入的、定性的、小样本量的方法来理解并生成假设,再用广泛的定量方法来衡量规模并加以确认。第二种张力是速度与严谨性之间的矛盾:持续的轻量级研究能让团队每周都有所学,但正是这种让它有价值的速度,也让人容易在招募和方案上偷工减料。解决办法是让严谨程度与决策的可逆程度相匹配。把真正的方法论功夫,用在那些代价高昂、难以撤回的决策上(核心流程、信息架构、平台赌注),而在下个冲刺就能改动的细节上可以快一些、松一些。

与团队讨论的问题

  1. 当我们做出一个产品赌注时,能改变我们想法的最小一块研究是什么?我们愿意在做出承诺之前先运行它吗? 团队在原则上都喜欢研究,却在截止日期的压力下跳过它,所以真正的问题是证据对路线图究竟有没有任何权威性。提前决定什么样的证据算作反证,因为一项无论结果如何你都会忽略的研究,是在浪费每个人的时间,也是一种表演形式。这一点对那些代价高昂、难以逆转的决策最为重要,在那种情况下,一周的探索相对于数月构建错误方向的成本而言微不足道。带上一项当前的决策,大声说出那个会让你改变方向的发现是什么。如果没有任何发现能改变它,那你做的就不是研究,而是在收集心理安慰,你要么诚实地做出承诺,要么把这个决策重新打开讨论。

  2. 我们测试的对象真的像使用产品的那些人吗?尤其是那些挣扎最多的人? 招募自信、人脉广、随时有空的志愿者是件舒服的事,而这种舒适会得到一份讨喜却虚假的读数,反映不出你产品的真实可用性。那些最需要软件好用的人()残障用户、处于危机中的人、数字信心不足的人()通常是最难招募的,所以除非你为他们争取,否则他们会悄悄地从样本中消失。把你最近三次研究的参与者人口统计信息拿出来,和你真实的用户群体或你的公共服务义务对照一下。如果结果偏向容易触达的用户,那你的信心就是错位的,你应该在信任下一轮发现之前,先修复招募渠道、与社区组织建立合作关系、并调整激励措施。

  3. 我们的研究发现存放在哪里?六个月后,另一个团队能找到并复用它们吗? 在一个大型组织中,同一个问题会被反复研究,只因为没有人能找到第一个团队已经花钱买来的答案,这纯粹是把浪费包装成了尽职尽责。决定好谁拥有这个洞见仓库、研究成果如何被打标签和总结,以及最简可行的书面记录是什么样子,让捕获一项发现变得足够快,人们才会真正去做。考虑一下当发现被复用和分享时,知情同意和参与者隐私会发生什么,因为不加注意的复用是一个合规与信任问题。带上最近的一项决策,试着追溯它背后的证据。如果你无法在几分钟之内找到那项研究,你的研究成果正以比你产出它们更快的速度蒸发。

  4. 当我们引用”大约五个用户”这条规则时,这个产品实际上服务多少个不同的细分群体?我们是否为每一个都测试了真实样本? 当一个产品有若干个有意义的不同用户群体时,“五用户”经验法则就会变成一个陷阱,因为来自一个群体的五个参与者对其他群体什么都说明不了,然而这个数字却被引用得仿佛一轮测试就为所有人一锤定音了。对于向一个共享产品发布功能的大型团队而言,细分群体会迅速增多:不同的角色、地区、设备、无障碍需求和专业水平,而每一个有意义的不同群体都需要自己的一小批参与者。与之相竞争的压力是成本和进度,因为每一轮都测试每一个细分群体代价高昂,所以要决定哪些细分群体承担的风险最大,每一轮都覆盖它们,其余的则轮换覆盖。带上你实际的细分群体图谱,以及近期几轮测试中每个细分群体的参与者人数,并诚实地说明你从未观察过哪些群体。在企业和政府环境中,由于被困用户和公共服务义务意味着被忽视的细分群体无法简单地流失掉,一个未经测试的细分群体,就是一群你正在默默辜负的人群,这个缺口应该被明确写入计划,作为明确的覆盖范围,而不是被一个平均化掉的统计数字所掩盖。

  5. 谁有权在这里运行一项研究?是什么阻止一个未经训练的热心者大规模产出言之凿凿的胡说八道? 让研究民主化能让更多团队更快地学习,但如果没有模板、培训和评审,它同样也会放大带偏见的方案、诱导性问题和一厢情愿的综合分析,于是学习的量和糟糕结论的量会一起增长。这里的张力在于吞吐量与信任之间:如果一切都通过少数几位研究人员把关,他们就会成为瓶颈;如果不设护栏地打开闸门,你就会用没有人应该据此行动的发现淹没整个组织。决定哪些类型的研究可以安全地委托出去,比如一次快速的无主持人任务测试,哪些则需要经过训练的手来操刀,比如敏感话题、脆弱参与者或信息架构方面的赌注,并带上模板、评审环节,以及对近期自助式研究的一次诚实审计,看看其中有多少能经得起推敲。对于一个大型企业或政府机构,再加上采购和隐私这个角度:共享的研究工具往往是采购来的,而一个允许任何人在没有知情同意跟踪的情况下联系参与者的自助式平台,是一个随时可能爆发的合规事件,所以护栏既关乎方法质量,也同样关乎合法的数据处理。

  6. 当我们的分析数据和访谈对同一个功能讲述截然相反的故事时,这个团队如何决定该相信哪一个? 定性信号和定量信号回答的是同一个问题的两个不同半边,而把两者之间的矛盾当作一件靠资历来摆平的麻烦事,会丢掉你手头最有用的线索,因为通常是其中一方衡量到了你没有意识到自己在衡量的东西。对于一个大型组织,风险在于部落主义:一个只信任仪表盘的数据团队,和一个只信任会话记录的研究团队,各自否定对方,而不是把两者结合起来阅读。带上一次真实的近期分歧,把分析数据显示的流失情况与研究给出的原因并排放在一起,走一遍这个循环:分析数据显示在哪里出了问题,研究解释为什么,一次实验衡量一项修复是否改变了这个数字。在企业和政府环境中,由于单一指标可能左右资金拨付或一项公开承诺,要提前指明当两者出现分歧时由谁来裁决、什么样的证据能平息争论,这样决策才立足于三角验证后的判断,而不是取决于谁在会议室里声音最大。

行业视角

创业公司。 团队人少、跑道有限,要把研究当作你能买到的最便宜的保险,而不是一个阶段。让一位创始人在写大量代码之前,用纸质原型运行五场有主持人的会话,把任务设定为目标而不是操作指令,并让你所观察到的东西在想法还只是草图阶段时,就能扼杀或调整它。跳过仓库和评审小组;整件事的意义在于学得足够快,从而避免构建错误的东西。

小型企业。 你很可能没有专职研究人员,预算也紧张,所以要依靠低成本的无主持人测试工具和轻量级访谈,而不是一个有专人配置的研究职能。在购买可用性测试软件时,优先选择能替你处理招募和知情同意的工具,因为在你的规模上,自己搭建那套机器很少值得。测试那几个决定你成败得失客户的流程,并严格执行不诱导证人的任务撰写原则,因为一个糟糕的方案会浪费掉你本就不多的预算。

企业。 由于许多小组向共享产品发布功能,制约因素是治理:一个可搜索的洞见仓库、一个带知情同意跟踪的托管参与者面板,以及一个让研究成为习惯而非临时抱佛脚的研究节奏。在模板、培训和评审的护栏内让研究民主化,这样量能扩大而不会放大糟糕的方案,并确保发现被打上标签、可供审计,这样两个小组就不会为了回答同一个问题而付两次钱。把参与者数据当作受监管的数据来对待:留存、知情同意和联系频率都需要有政策。

政府。 许多国家级数字服务标准强制要求用户研究,并要接受评估,所以要把它当作一道服务必须通过、并附有证据的关卡。采购规则塑造你的工具和招募供应商,透明度意味着记录清楚你测试的对象是谁、发现了什么,而公共问责意味着要招募最难触达的用户,包括辅助数字参与者和残障参与者,因为一项排除他们的服务,就是在剥夺人们应得的权益。保留清晰的知情同意和方法记录,让评估人员、审计员或公众都能看到这项研究是真实进行过的。

示例

创业公司。 一家六人规模、为自由职业者开发报销软件的创业公司,坚信杀手级功能是自动收据扫描,并已经开发出了一个粗糙的版本。在进一步投入之前,两位创始人用纸质原型,与真实的自由职业者一起运行了五场有主持人的可用性会话,把任务设定为目标(“记录你刚刚报销的那杯咖啡”)而不是操作指令。五人中有四人完全无视了扫描功能,改为手动输入金额,因为他们真正焦虑的不是录入数据的速度,而是这笔报销能否经受住税务审计的考验。团队围绕经得起审计的分类方式和清晰的凭证轨迹调整了产品方向,在迭代过程中又运行了两轮小规模测试,把一个停滞不前的免费试用变成了付费订阅用户,而这一切的成本只是一周的草图和对话。

企业。 一家全球物流公司正在各个站点之间统一仓库软件,并设立了一个常设的研究运营职能,让数十个产品小组保持诚实。他们建立了一个带标签的洞见仓库、一个由同意接受定期会话的仓库员工组成的托管面板,以及一个每两周一次的研究节奏。当两个小组各自独立地提议重新设计同一个扫描工作流时,一次对仓库的检索发现了上一季度的一份情境访查,显示手套和冷库条件、而非屏幕布局,才是大多数扫描错误的元凶。这一条被复用的单一发现,让两个小组都转向了更大的点击目标和适合戴手套操作的交互方式,避免了重复的探索工作,并在上线后可测量地减少了误扫。

政府。 一家国家医疗服务机构在重新设计其预约挂号服务时,把用户研究当作其数字服务标准下的强制要求,而不是可选项。团队除了针对人口构成广泛的样本进行有主持人的可用性测试之外,还与通常依赖亲属或图书馆助理的人一起运行了辅助数字会话,并通过与慈善机构的合作,招募了使用屏幕阅读器和开关访问设备(第 5.3 章)的残障参与者。测试揭示出,小节标题中的临床术语,导致年长用户和信心不足的用户在遇到真正的障碍之前就放弃了。团队围绕患者的平实语言目标重新组织了内容,然后通过一次大规模的无主持人研究以及一次实时分析对比(第 7.4 章)确认了成效,提高了成功的自助预约率,并降低了呼叫中心的负荷,同时改善了服务成本和获取服务的公平性。

商业理由:动机、投资回报率与总拥有成本

研究的回报来自三个杠杆。第一,避免浪费:在一周的探索阶段就抓住一个错误的方向,而不是在一个季度的工程投入之后才发现,这是最大也最容易被低估的节省,恰恰是因为那次被浪费的构建工作从未发生,也就永远不会出现在报告里。第二,更高的成功率:更多用户完成有价值的任务,这在消费产品中表现为转化率,在用户被困的企业环境中则表现为生产力提高和错误减少。第三,更低的服务成本:好用的服务会带来更少的支持请求、更少的培训需求,以及更少需要事后纠正的下游错误。

总拥有成本必须权衡做研究的成本与跳过研究的成本。做研究的成本是看得见的,也相对适中:研究人员、招募和激励措施、工具、一个仓库,以及排期中的时间。跳过研究的成本更大,却分散在其他预算里:放弃的交易、支持工单、培训天数、代价高昂的后期重新设计、失败的发布,以及在公共部门中,对公民的排斥以及随之而来的法律和声誉风险。由于这些成本隐藏在支持、培训和运营环节,而不是产品线里,领导层往往会系统性地低估它们,这正是为什么研究看起来可有可无,直到一次发布失败为止。

要说明理由,把研究与高管们已经在关注的数字联系起来:完成率和转化率、单笔交易成本、支持量、培训时间,以及错误和返工率。在一个真实流程上运行一次小规模、有埋点的前后对比,展示出变化,并将其推演到整个产品组合中。把研究定性为对不可逆决策的风险削减,这种语言能引起财务和治理利益相关者的共鸣,他们或许永远不会去读一份可用性报告,却能理解一场可能出错的赌注。

反模式与陷阱

  • 研究表演:为一个已经做出的决策进行研究只是为了自我证明,当发现结果不方便时就被悄悄忽略。
  • 诱导证人:提前暴露出期望答案的任务和问题,产生毫无意义的讨喜数据。
  • 带确认偏误的综合分析:只听取符合计划的观察结果,把其余的都丢弃。
  • 五用户谬误:把”大约五个用户”当作一条普适法则,却忽略了它假定的是单一细分群体,而且只能发现严重问题,无法衡量成功率。
  • 图便利招募:只测试容易触达的人,导致残障用户和难以触达的用户从样本中消失。
  • 相信表述出来的偏好:相信”是的,我会用这个”,而不去观察人们实际做了什么。
  • 洞见的坟场:发现的问题被埋在某一个团队的幻灯片里,于是同一个问题被反复研究。
  • 没有护栏的民主化:让任何人都可以在没有模板或评审的情况下运行研究,放大带偏见的方案和站不住脚的结论。
  • 定性与定量之间的部落主义:偏爱某一种数据来源、排斥另一种,而不是进行三角验证。

成熟度模型

  • 第 1 级,启动: 研究是临时性的,或者根本不存在,决策依赖于意见和资历。可用性测试即便发生,也是上线前找个顺手的人临时做一次的被动行为,而发现的问题很少改变任何东西。
  • 第 2 级,发展: 一些团队会运行可用性测试和偶尔的访谈,但招募图方便,方案不正式,洞见散落在各处的幻灯片里。各小组之间的实践差异很大,研究是一个在进度压力下会被砍掉的阶段。
  • 第 3 级,标准化: 生成式研究和评估式研究都有文档记录,并在各团队之间持续运行,通过一套共享流程来影响优先级排序。招募目标覆盖真实的细分群体,包括残障用户和难以触达的用户,存在一个可搜索的洞见仓库,综合分析能产出按优先级排序的决策,研究运营在组织范围内管理节奏、模板和参与者。
  • 第 4 级,管理: 研究项目依据基线被度量。团队追踪用户细分群体的覆盖率、任务成功率和完成率、从洞见到上线变更的耗时,以及对支持量、培训时间和错误返工率的下游影响,并设定阈值,一旦某项指标下滑就触发行动。仓库的复用率和研究质量都受到监控,这样领导者就能看到研究产生的回报,而不是仅凭假设。
  • 第 5 级,编排: 研究是一个与分析数据和实验相三角验证的持续闭环,从洞见到上线变更再到被衡量的效果,形成闭环,并与整个组织的产品战略和风险规划相整合。民主化后的研究在护栏内安全运行,发现的问题不断积累,并随着产品及其用户的变化而调整,研究能切实地塑造战略,而不仅仅是塑造界面。

讨论话题

  1. 在承诺构建之前,多少探索才算”足够”?谁有权决定你已经学得够多了?
  2. 当分析数据和访谈对同一个功能讲述截然相反的故事时,团队应该如何决定该依据哪一个采取行动?
  3. 负责任地让研究民主化,与放任未经训练的热情大规模产出带偏见的研究,两者之间的界线在哪里?
  4. 一项研究的价值,是一个你因此从未犯过、也永远无法指出来的错误,你如何衡量这种研究的回报?
  5. 与处于危机或脆弱境况中的人开展研究,怎样才算是符合伦理,且不会加重他们的负担?
  6. 像政府服务标准中那样的强制性用户研究,是否应该成为一道能阻止发布的关卡?由谁来执行它?

关键要点

  • 研究的存在是为了降低构建错误事物的风险,它在你构建之前是最便宜的。
  • 把生成式研究(找到正确的问题)与评估式研究(检验解决方案)区分开来;根据问题来选择方法。
  • “大约五个用户”能在每一轮中发现单一细分群体的大多数严重问题,但它无法衡量成功率,也无法覆盖不同的群体。
  • 把任务写成真实的目标,询问过去的行为,并设计出对抗诱导性问题和确认偏误的机制。
  • 招募真正能代表你用户的参与者,包括残障用户和难以触达的人,否则你的发现就是悄悄失真的。
  • 把研究综合成按优先级排序的决策,而不是幻灯片;检验标准是有没有一项决策真的因此改变。
  • 用分析数据和实验对定性研究进行三角验证,并把发现记录在一个共享仓库中,让学习不断积累。

参考文献与延伸阅读

  • Erika Hall, Just Enough Research
  • Steve Krug, Rocket Surgery Made Easy
  • Jakob Nielsen, Usability Engineering
  • Mike Kuniavsky, Observing the User Experience
  • Steve Portigal, Interviewing Users
  • Tomer Sharon, Validating Product Ideas: Through Lean User Research
  • Hugh Beyer and Karen Holtzblatt, Contextual Design
  • Donna Spencer, Card Sorting: Designing Usable Categories
  • Kathy Baxter, Catherine Courage, and Kelly Caine, Understanding Your Users
  • Kate Towsey, Research That Scales: The Research Operations Handbook
  • Nielsen Norman Group, articles on usability testing, sample size, and research methods
  • UK Government Digital Service, Service Manual: user research guidance