5.8 Pesquisa de design e testes de usabilidade
Visão geral e motivação
A pesquisa com usuários é a disciplina de aprender sobre as pessoas para quem vocês constroem: seus objetivos, contextos, tarefas e os obstáculos que as fazem tropeçar. Seu valor central é a redução de risco. O erro mais caro em software não é um bug nem um prazo perdido: é construir bem a coisa errada e descobrir depois do lançamento que ninguém precisava dela ou que ninguém conseguia usá-la. A pesquisa compra a redução desse risco de forma barata, antes de vocês despejarem engenharia numa direção que se revela errada. O capítulo 5.1 estabelece os fundamentos de UX. Este capítulo vai fundo nos dois motores que mantêm esses fundamentos honestos: a pesquisa generativa, que diz o que construir, e a pesquisa avaliativa, que diz se o que vocês construíram de fato funciona.
Para grandes equipes as apostas se multiplicam. Quando muitos esquadrões entregam num único produto, cada um faz apostas sobre os usuários a cada sprint, e sem um hábito compartilhado de pesquisa essas apostas são apenas opiniões vestindo a fantasia da confiança. Um fluxo pequeno e constante de evidências dá a todos a mesma realidade para argumentar, de modo que os debates terminem em “vamos observar alguns usuários” e não em quem tem mais senioridade ou a voz mais alta. A pesquisa também viaja: um estudo bem conduzido pode corrigir as suposições de uma dúzia de equipes de uma só vez, se vocês o capturarem e compartilharem bem.
Empresas e governo elevam de novo a barra. O software corporativo muitas vezes tem usuários cativos que não podem sair, então as ferramentas inutilizáveis são pagas em erros, treinamento e horas perdidas e não em evasão que se vê num painel. Os serviços governamentais alcançam o público inteiro, inclusive pessoas em crise, em celulares antigos, com pouca confiança digital ou sem outra opção. Muitos padrões nacionais de serviço digital agora tornam obrigatória a pesquisa com usuários exatamente por esse motivo, porque um formulário que ninguém consegue terminar nega às pessoas benefícios a que têm direito. Aqui a pesquisa não é uma gentileza. É como vocês mantêm uma promessa pública.
Princípios fundamentais
- A pesquisa reduz o risco de construir a coisa errada. É mais barata antes de construir, não depois.
- A pesquisa generativa acha o problema certo. A pesquisa avaliativa confere a solução. Vocês precisam das duas.
- Observem o que as pessoas fazem, não apenas o que dizem. A preferência declarada e o comportamento real divergem.
- Os métodos qualitativos explicam o porquê. Os quantitativos dimensionam quantos. Combinem-nos.
- Pequena e contínua vence rara e pesada. Alguns usuários toda semana ensinam mais que um grande estudo por ano.
- Seus achados só são tão representativos quanto seus participantes, então recrutem deliberadamente, inclusive usuários com deficiência e de difícil alcance.
- O discernimento que vive nos slides de uma equipe se perde. Capturem a pesquisa para que a organização inteira possa reutilizá-la.
- O viés se infiltra por perguntas indutoras e por sínteses movidas a desejo. Projetem contra ele de propósito.
Recomendações
Separe a pesquisa generativa da avaliativa
Sejam explícitos sobre qual pergunta estão fazendo, porque os métodos diferem. A pesquisa generativa (ou de descoberta) é aberta e explora um espaço de problema antes de vocês terem uma solução: o que as pessoas realmente tentam realizar? Onde a experiência atual dói? O que elas contornam? A pesquisa avaliativa testa um design específico contra uma tarefa: as pessoas conseguem completá-la, e onde tropeçam? Confundir as duas desperdiça ambas. Conduzir uma sessão de teste de usabilidade rigidamente roteirizada quando vocês ainda não entendem o problema dá respostas polidas à pergunta errada, enquanto uma conversa sem estrutura quando vocês precisam validar um fluxo de checkout os deixa adivinhando. Nomeiem primeiro a pergunta de pesquisa, depois escolham o método, e alimentem os achados generativos na descoberta de produto (capítulo 10.14), onde o roteiro é de fato moldado.
Combine o método com a pergunta
Não existe método para todos os fins, apenas ajustes. As entrevistas com usuários trazem à tona motivações, modelos mentais e histórico, e são o seu cavalo de batalha para a descoberta. A investigação contextual, em que vocês observam as pessoas fazendo trabalho real no próprio ambiente, revela as gambiarras e interrupções que as pessoas nunca mencionam numa sala de reunião. As pesquisas de opinião medem atitudes e frequências numa grande população mas não conseguem explicar as razões por trás delas e punem com brutalidade um desenho descuidado das perguntas. A classificação de cartões (card sorting) e o teste de árvore derivam e validam a arquitetura da informação a partir dos modelos mentais dos usuários: a classificação de cartões pede às pessoas que agrupem e rotulem conceitos, enquanto o teste de árvore confere se elas conseguem achar coisas numa estrutura proposta. Os estudos de diário capturam comportamento que se desenrola ao longo de dias ou semanas, como a integração ou a formação de hábito, que nenhuma sessão isolada enxerga. Uma heurística simples: usem entrevistas e investigação contextual para entender as pessoas, classificação de cartões e teste de árvore para estruturar a informação, pesquisas de opinião e estudos de diário para ver ao longo do tempo e da escala e teste de usabilidade para conferir um design.
Conduza testes de usabilidade cedo, com frequência e pequenos
O teste de usabilidade é o método avaliativo de maior alavancagem, e vocês podem começá-lo com esboços em papel muito antes de existir código. A conhecida heurística é que cerca de cinco usuários por rodada revelam a maioria dos problemas graves e óbvios de usabilidade, então é melhor conduzir três rodadas de cinco à medida que o design evolui do que um grande estudo de quinze no fim. Entendam, porém, os limites da heurística. Cinco usuários bastam apenas para um único grupo homogêneo descobrindo grandes problemas. Não medem taxas de sucesso, não cobrem segmentos distintos de usuários (cada grupo significativamente diferente precisa do seu próprio punhado) e não pegam problemas raros mas graves. Escolham o teste moderado quando quiserem sondar o raciocínio, adaptar-se na hora e tratar tarefas complexas ou sensíveis, e o não moderado quando quiserem velocidade, volume, alcance geográfico e menor custo para fluxos simples. A maioria das equipes maduras conduz os dois: moderado para entender, não moderado para confirmar em escala.
Escreva tarefas e perguntas que não induzam a testemunha
Seu estudo só é tão confiável quanto o seu protocolo, e o jeito mais rápido de arruiná-lo é telegrafar a resposta que vocês esperam. Deem aos participantes objetivos realistas, não instruções: digam “você acabou de se mudar e precisa atualizar o seu endereço” e não “clique no botão Editar Perfil e mude o seu endereço”. Perguntem sobre o comportamento passado em vez de intenções futuras, porque “você usaria isto?” produz com segurança mentiras educadas enquanto “conte-me sobre a última vez que você fez isto” produz fatos. Evitem perguntas que presumem a própria conclusão e fiquem atentos ao viés de confirmação, a tendência humana de notar e lembrar evidências que sustentam o que já se acredita. O pesquisador que escreveu o design não deve conduzir em silêncio os participantes ao sucesso, e a equipe que observa deve registrar o que aconteceu antes de debater o que significa. Quando vocês separam o design e a comunicação das tarefas do design do produto (capítulo 5.4), obtêm um sinal mais limpo.
Recrute participantes que de fato representem os seus usuários
Os achados herdam o viés do seu recrutamento. Se vocês só testam com voluntários confiantes, conectados e à vontade com tecnologia, entregarão algo que funciona lindamente para pessoas que mal precisavam de ajuda e falha com as que mais precisavam. Definam seus segmentos e depois recrutem contra eles deliberadamente, incluindo usuários com deficiência que dependem de tecnologia assistiva (capítulo 5.3) e grupos de difícil alcance, como pessoas em crise, pessoas com pouca confiança digital, usuários mais velhos e quem está em conexões lentas ou dispositivos antigos. Alcançar esses participantes exige mais esforço e muitas vezes parcerias com organizações comunitárias, incentivos apropriados e logística flexível, mas pular isso não faz os usuários desaparecerem: só move a descoberta para a produção, onde é muito mais cara e muito mais danosa. Façam uma triagem cuidadosa para obter membros reais de um segmento e não testadores profissionais que manipulam os incentivos.
Sintetize os achados em decisões, não apenas em relatórios
Observações brutas não são discernimento. O trabalho da síntese é transformar uma pilha de notas de sessões em um pequeno número de decisões em que a equipe pode agir. O mapeamento de afinidade, agrupar observações individuais em temas (a prática por trás do diagrama de afinidade), é o movimento padrão para tornar visíveis os padrões entre sessões. Para estudos pesados em entrevistas, uma análise temática leve os mantém honestos sobre quais temas são de fato sustentados pelos dados. Levem os padrões duráveis para os modelos compartilhados do capítulo 5.1, personas baseadas em evidências e mapas de jornada, para que o discernimento se componha em vez de evaporar. O teste de uma boa síntese é simples: uma decisão mudou? Um estudo que produz um belo conjunto de slides e nenhum item de roteiro alterado foi teatro. Terminem todo estudo com uma curta lista ordenada de achados e uma ação recomendada para cada um.
Triangule a pesquisa qualitativa com análise de dados e experimentação
A pesquisa qualitativa e os dados quantitativos respondem a metades diferentes da mesma pergunta, e cada um cobre o ponto cego do outro. A pesquisa explica por que os usuários se comportam como se comportam mas só vê o punhado de pessoas na sala. A análise de dados e a experimentação (capítulo 7.4) veem a população inteira mas não conseguem explicar a motivação nem pegar os problemas de pessoas que nunca se tornaram usuárias. Usem-nos como um ciclo: a análise mostra um abandono, a pesquisa o explica, um redesenho o trata e um experimento mede se a correção moveu o número. Quando os sinais qualitativos e quantitativos discordam, tratem a contradição como uma pista e não como um incômodo, porque em geral um dos dois está medindo algo que vocês não perceberam que mediam. Nenhuma das fontes é chefe da outra. A decisão vem de lê-las juntas.
Construa operações de pesquisa para que a pesquisa escale
Assim que mais de duas equipes fazem pesquisa, o gargalo deixa de ser o método e passa a ser a logística: recrutamento, agendamento, consentimento, incentivos, armazenamento de notas e achar o estudo do trimestre passado antes de alguém repeti-lo. As operações de pesquisa (ResearchOps) são a prática de tornar confiável essa maquinaria. Invistam num repositório de discernimentos pesquisável, para que os achados sejam marcados, descobríveis e reutilizáveis entre as equipes, num sistema de gerenciamento de participantes que respeite o consentimento, a privacidade e a frequência com que vocês contatam as pessoas e numa cadência regular de pesquisa, para que os estudos sejam um hábito constante e não uma correria. Democratizar a pesquisa, deixando não pesquisadores conduzirem alguns estudos, vale a pena, mas só com proteções: modelos, treinamento e revisão, para escalar o volume de aprendizado sem escalar o volume de protocolos ruins e conclusões enviesadas.
Compromissos: prós e contras
| Método | Melhor para | Prós | Contras |
|---|---|---|---|
| Entrevistas com usuários | Descoberta, motivações | Porquê profundo, flexível, barato de começar | N pequeno, propenso a viés do entrevistador |
| Investigação contextual | Comportamento no mundo real | Revela gambiarras e contexto | Demorada, difícil de agendar |
| Pesquisas de opinião | Atitudes em escala | N grande, quantificável | Não explicam o porquê, fáceis de escrever mal |
| Classificação de cartões e teste de árvore | Arquitetura da informação | Fundamenta a estrutura em modelos mentais | Escopo estreito, exige análise cuidadosa |
| Estudos de diário | Comportamento ao longo do tempo | Captura padrões longitudinais | Alta desistência, esforço do participante |
| Teste de usabilidade moderado | Entender um design | Sondagem, adaptativo, rico | Mais lento, mais caro, pesado em agendamento |
| Teste de usabilidade não moderado | Confirmar em escala | Rápido, barato, geograficamente amplo | Sem acompanhamento, raso em tarefas complexas |
A tensão central é profundidade versus escala, e a resolução é a sequência e não a escolha. Usem métodos profundos, qualitativos e de N pequeno para entender e gerar hipóteses, depois usem métodos amplos e quantitativos para dimensioná-las e confirmá-las. Uma segunda tensão é velocidade versus rigor: a pesquisa leve e contínua mantém a equipe aprendendo toda semana, mas a mesma velocidade que a torna valiosa facilita cortar caminho no recrutamento e no protocolo. Resolvam combinando o rigor com a reversibilidade. Gastem cuidado metodológico real em decisões caras de desfazer (fluxos centrais, arquitetura da informação, apostas de plataforma) e andem depressa e soltos nos detalhes que vocês podem mudar no próximo sprint.
Perguntas para discutir com sua equipe
Quando fazemos uma aposta de produto, qual é o menor pedaço de pesquisa que mudaria a nossa opinião, e estamos dispostos a conduzi-lo antes de nos comprometer? As equipes amam a pesquisa em princípio e a pulam sob pressão de prazo, então a pergunta real é se a evidência tem alguma autoridade sobre o roteiro. Decidam de antemão o que contaria como evidência contrária, porque um estudo que vocês ignorariam de qualquer jeito é uma perda de tempo para todos e uma forma de teatro. Isso importa mais para decisões caras de reverter, onde uma semana de descoberta é trivial ao lado de meses construindo a coisa errada. Levem uma decisão atual e nomeiem, em voz alta, o achado que os faria mudar de rumo. Se nenhum achado poderia mudá-la, vocês não estão fazendo pesquisa, estão colecionando tranquilização, e devem ou se comprometer com honestidade ou reabrir a decisão.
As pessoas com quem testamos de fato se parecem com as que usam o produto, especialmente as que mais penam? É confortável recrutar voluntários confiantes, conectados e disponíveis, e esse conforto produz uma leitura lisonjeira e falsa de quão utilizável o produto realmente é. Os usuários que mais precisam de que o software funcione bem, usuários com deficiência, pessoas em crise, pessoas com pouca confiança digital, costumam ser os mais difíceis de recrutar, então saem da amostra em silêncio a menos que vocês lutem por eles. Puxem os dados demográficos dos participantes dos últimos três estudos e ponham-nos ao lado da sua base real de usuários ou das suas obrigações de serviço público. Se pendem para usuários fáceis de alcançar, a sua confiança está mal colocada, e vocês devem consertar o pipeline de recrutamento, fazer parceria com organizações comunitárias e ajustar os incentivos antes de confiar em outra rodada de achados.
Onde vivem os nossos achados de pesquisa, e outra equipe conseguiria achá-los e reutilizá-los daqui a seis meses? Numa grande organização a mesma pergunta é pesquisada de novo e de novo porque ninguém achou a resposta que a primeira equipe já pagou, o que é puro desperdício vestido de diligência. Decidam quem é dono do repositório de discernimentos, como os estudos são marcados e resumidos e qual é o relato mínimo viável, de modo que capturar um achado seja rápido o bastante para as pessoas de fato fazerem. Considerem o que acontece com o consentimento e a privacidade dos participantes à medida que os achados são reutilizados e compartilhados, porque reutilizar sem cuidado é um problema de conformidade e de confiança. Levem uma decisão recente e tentem rastrear a evidência por trás dela. Se vocês não acham o estudo em poucos minutos, a sua pesquisa está evaporando mais depressa do que vocês a produzem.
Quando citamos a regra de “cerca de cinco usuários”, quantos segmentos distintos este produto de fato atende, e estamos testando uma amostra real de cada um? A heurística dos cinco usuários vira uma armadilha quando um produto tem vários grupos de usuários significativamente diferentes, porque cinco participantes de um grupo não dizem nada sobre os outros, e ainda assim o número é citado como se uma rodada resolvesse o assunto para todos. Para uma grande equipe que entrega num produto compartilhado, os segmentos se multiplicam depressa: papéis, regiões, dispositivos, necessidades de acessibilidade e níveis de especialização diferentes, e cada grupo significativamente diferente precisa do seu próprio punhado. A pressão concorrente é custo e cronograma, já que testar todo segmento a cada rodada é caro, então decidam quais segmentos carregam mais risco, cubram esses em cada rodada e façam rodízio do resto. Levem o mapa real de segmentos e as contagens de participantes por segmento das rodadas recentes e sejam honestos sobre quais grupos vocês nunca observaram. Em contextos corporativos e governamentais, onde os usuários cativos e as obrigações de serviço público significam que o segmento negligenciado não pode simplesmente ir embora, um segmento não testado é uma população que vocês estão falhando em silêncio, e essa lacuna pertence ao plano como cobertura explícita e não como uma estatística diluída na média.
Quem tem permissão para conduzir um estudo aqui, e o que impede um entusiasta sem treinamento de produzir bobagem confiante em escala? Democratizar a pesquisa permite a mais equipes aprender mais depressa, mas sem modelos, treinamento e revisão ela também escala protocolos enviesados, perguntas indutoras e sínteses movidas a desejo, então o volume de aprendizado e o de conclusões ruins sobem juntos. A tensão é entre vazão e confiança: canalizem tudo por poucos pesquisadores e eles viram o gargalo, abram as comportas sem proteções e vocês inundam a organização de achados em que ninguém deveria agir. Decidam quais tipos de estudo são seguros de delegar, como um rápido teste de tarefa não moderado, versus quais exigem uma mão treinada, como temas sensíveis, participantes vulneráveis ou apostas de arquitetura da informação, e levem os modelos, a etapa de revisão e uma auditoria honesta dos estudos recentes feitos por autoatendimento para ver quantos sobreviveriam ao escrutínio. Para uma grande empresa ou órgão governamental, acrescentem o ângulo da contratação e da privacidade: as ferramentas compartilhadas de pesquisa muitas vezes são compradas, e uma plataforma de autoatendimento que deixa qualquer um contatar participantes sem rastreamento de consentimento é um incidente de conformidade esperando para acontecer, então as proteções são tanto sobre o tratamento legal de dados quanto sobre a qualidade do método.
Quando a nossa análise de dados e as nossas entrevistas contam histórias opostas sobre a mesma funcionalidade, como esta equipe decide em qual acreditar? Os sinais qualitativos e quantitativos respondem a metades diferentes de uma pergunta, e tratar uma contradição entre eles como um incômodo a resolver por senioridade joga fora a pista mais útil que vocês têm, porque em geral uma das fontes está medindo algo que vocês não perceberam que mediam. Para uma grande organização o risco é o tribalismo: uma equipe de dados que só confia em painéis e uma de pesquisa que só confia em sessões, cada uma desprezando a outra em vez de lê-las juntas. Levem um desacordo recente real, o abandono da análise de dados ao lado das razões da pesquisa, e percorram o ciclo da análise mostrando onde, da pesquisa explicando por quê e de um experimento medindo se a correção moveu o número. Em contextos corporativos e governamentais, onde uma única métrica pode conduzir financiamento ou um compromisso público, nomeiem de antemão quem arbitra quando os dois discordam e que evidência encerra a discussão, para que a decisão repouse numa leitura triangulada e não na função com o advogado mais barulhento na sala.
Perspectiva por setor
Startup. Com um punhado de pessoas e nenhuma pista para desperdiçar, tratem a pesquisa como o seguro mais barato que podem comprar, não como uma fase. Peçam a um fundador que conduza cinco sessões moderadas em protótipos de papel antes de escrever muito código, enquadrando as tarefas como objetivos e não como instruções, e deixem o que vocês observam matar ou redirecionar a ideia enquanto ainda são esboços. Pulem o repositório e o painel. O ponto inteiro é aprender depressa o bastante para evitar construir a coisa errada.
Pequena empresa. Vocês provavelmente não têm pesquisador dedicado e têm orçamento apertado, então apoiem-se em ferramentas baratas de teste não moderado e em entrevistas leves em vez de uma função de pesquisa com pessoal. Ao comprar software de teste de usabilidade, favoreçam ferramentas que tratem por vocês o recrutamento e o consentimento, já que construir essa maquinaria vocês mesmos raramente compensa na sua escala. Testem os poucos fluxos que fazem ou perdem um cliente e sejam disciplinados em escrever tarefas que não induzam a testemunha, porque um protocolo ruim desperdiça o pouco orçamento que vocês têm.
Grande empresa. Com muitos esquadrões entregando em produtos compartilhados, a restrição é a governança: um repositório pesquisável de discernimentos, um painel gerenciado de participantes com rastreamento de consentimento e uma cadência de pesquisa para que os estudos sejam um hábito e não uma correria. Democratizem a pesquisa dentro de proteções de modelos, treinamento e revisão para que o volume escale sem escalar protocolos ruins e garantam que os achados sejam marcados e auditáveis para que dois esquadrões nunca paguem duas vezes para responder à mesma pergunta. Tratem os dados dos participantes como regulados: retenção, consentimento e frequência de contato precisam de política.
Governo. Muitos padrões nacionais de serviço digital tornam a pesquisa com usuários obrigatória e sujeita a avaliação, então tratem-na como um portão que um serviço precisa passar, com evidências. As regras de contratação moldam as suas ferramentas e fornecedores de recrutamento, a transparência significa documentar com quem vocês testaram e o que acharam, e a responsabilização pública significa recrutar os usuários mais difíceis de alcançar, inclusive participantes com assistência digital e com deficiência, porque um serviço que os exclui nega direitos às pessoas. Mantenham registros claros de consentimento e de método para que um avaliador, um auditor ou o público possa ver que a pesquisa foi real.
Exemplos
Startup. Uma startup de seis pessoas que constrói software de despesas para autônomos estava convencida de que a funcionalidade matadora era a leitura automática de recibos e tinha construído uma versão rudimentar. Antes de investir mais, dois fundadores conduziram cinco sessões moderadas de usabilidade com autônomos reais usando protótipos de papel, enquadrando as tarefas como objetivos (“registre o café que você acabou de lançar como despesa”) e não como instruções. Quatro dos cinco ignoraram por completo a leitura e digitaram os valores à mão, porque a ansiedade real deles não era a velocidade da digitação, mas se uma despesa sobreviveria a uma auditoria fiscal. A equipe redirecionou o produto em torno de uma categorização pronta para auditoria e de uma trilha de documentos clara, conduziu mais duas pequenas rodadas à medida que iterava e transformou um período de teste gratuito que empacava em assinantes pagantes, tudo pelo custo de uma semana de esboços e conversas.
Grande empresa. Uma empresa global de logística padronizava o software de armazéns entre unidades e montou uma função permanente de operações de pesquisa para manter honestos dezenas de esquadrões de produto. Construíram um repositório marcado de discernimentos, um painel gerenciado de funcionários de armazéns que consentiram em sessões periódicas e uma cadência quinzenal de pesquisa. Quando dois esquadrões propuseram de modo independente redesenhar o mesmo fluxo de leitura, uma busca no repositório trouxe uma investigação contextual do trimestre anterior mostrando que luvas e as condições de câmaras frias, e não o layout da tela, causavam a maior parte dos erros de leitura. Esse único achado reutilizado redirecionou os dois esquadrões para alvos de toque maiores e interações amigáveis a luvas, evitou descoberta duplicada e cortou mensuravelmente as leituras erradas depois de entregue.
Governo. Um serviço nacional de saúde que redesenhava seu serviço de marcação de consultas tratou a pesquisa com usuários como obrigatória sob seu padrão de serviço digital e não como opcional. Ao lado de testes moderados de usabilidade com uma amostra demograficamente ampla, a equipe conduziu sessões de assistência digital com pessoas que normalmente dependem de um parente ou de um assistente de biblioteca e recrutou participantes com deficiência que usam leitores de tela e acesso por chave (capítulo 5.3) por parcerias com instituições de caridade. Os testes revelaram que o jargão clínico nos títulos de seção fazia usuários mais velhos e menos confiantes desistirem antes de chegar a uma barreira real. Reestruturar o conteúdo em torno dos objetivos em linguagem simples dos pacientes, depois confirmar o ganho com um estudo não moderado em escala e uma comparação ao vivo de análise de dados (capítulo 7.4), elevou as marcações bem-sucedidas por autoatendimento e reduziu a carga da central de atendimento, melhorando o custo de servir e a equidade de acesso.
Justificativa de negócio: motivações, ROI e TCO
O retorno da pesquisa vem de três alavancas. Primeiro, o desperdício evitado: pegar uma direção errada numa semana de descoberta em vez de depois de um trimestre de engenharia é a maior e mais subcontada economia, justamente porque a construção desperdiçada nunca acontece e por isso nunca aparece num relatório. Segundo, o maior sucesso: mais usuários completando tarefas valiosas, o que aparece como conversão em produtos de consumo e como produtividade e menos erros em contextos corporativos onde os usuários são cativos. Terceiro, o menor custo de servir: serviços utilizáveis geram menos contatos de suporte, menos treinamento e menos erros a corrigir a jusante.
O custo total de propriedade precisa pesar o custo de fazer pesquisa contra o custo de pulá-la. Os custos de fazê-la são visíveis e modestos: pesquisadores, recrutamento e incentivos, ferramentas, um repositório e tempo no cronograma. Os custos de pulá-la são maiores mas espalhados por outros orçamentos: transações abandonadas, chamados de suporte, dias de treinamento, caros redesenhos tardios, lançamentos fracassados e, no setor público, a exclusão de cidadãos e a exposição jurídica e de reputação que se segue. Como esses custos se escondem em suporte, treinamento e operações e não na linha de produto, a liderança rotineiramente os subestima, que é exatamente por que a pesquisa parece opcional até um lançamento fracassar.
Para defender o caso, liguem a pesquisa a números que os executivos já acompanham: taxas de conclusão e de conversão, custo por transação, volume de suporte, tempo de treinamento e taxas de erro e de retrabalho. Conduzam um pequeno antes e depois instrumentado num fluxo real, mostrem o movimento e extrapolem para o portfólio. Enquadrem a pesquisa como redução de risco em decisões irreversíveis, a linguagem que ressoa com as partes interessadas de finanças e de governança que talvez nunca leiam um relatório de usabilidade mas entendem uma aposta que pode dar errado.
Antipadrões e armadilhas
- Teatro de pesquisa: estudos conduzidos para justificar uma decisão já tomada, com os achados discretamente ignorados quando inconvenientes.
- Induzir a testemunha: tarefas e perguntas que telegrafam a resposta desejada, produzindo dados lisonjeiros que não significam nada.
- Síntese enviesada pela confirmação: ouvir só as observações que se encaixam no plano e descartar o resto.
- A falácia dos cinco usuários: tratar “cerca de cinco usuários” como lei universal, ignorando que presume um segmento e só acha problemas graves, não taxas de sucesso.
- Recrutamento por conveniência: testar quem é fácil de alcançar, de modo que os usuários com deficiência e de difícil alcance somem da amostra.
- Confiança na preferência declarada: acreditar em “sim, eu usaria isso” em vez de observar o que as pessoas de fato fazem.
- Cemitérios de discernimentos: achados enterrados nos slides de uma equipe, de modo que a mesma pergunta é pesquisada de novo e de novo.
- Democratização sem proteções: deixar qualquer um conduzir estudos sem modelos nem revisão, escalando protocolos enviesados e conclusões frágeis.
- Tribalismo qualitativo versus quantitativo: escolher uma fonte favorita de dados e desprezar a outra em vez de triangular.
Modelo de maturidade
- Nível 1, Iniciar: A pesquisa é ad hoc ou ausente, e as decisões repousam em opinião e senioridade. O teste de usabilidade, se acontece, é um evento pontual e reativo antes do lançamento, com quem estiver à mão, e os achados raramente mudam alguma coisa.
- Nível 2, Desenvolver: Algumas equipes conduzem testes de usabilidade e entrevistas ocasionais, mas o recrutamento é por conveniência, os protocolos são informais e os discernimentos vivem em slides dispersos. A prática varia muito de esquadrão para esquadrão, e a pesquisa é uma fase que é cortada sob pressão de cronograma.
- Nível 3, Padronizar: A pesquisa generativa e a avaliativa são documentadas e conduzidas continuamente entre as equipes, alimentando a priorização por um processo compartilhado. O recrutamento mira segmentos reais, incluindo usuários com deficiência e de difícil alcance, existe um repositório pesquisável de discernimentos, a síntese produz decisões ordenadas e as operações de pesquisa gerenciam cadência, modelos e participantes em toda a organização.
- Nível 4, Gerenciar: O programa de pesquisa é medido em relação a linhas de base. As equipes acompanham a cobertura de segmentos de usuários, as taxas de sucesso e de conclusão de tarefas, o tempo do discernimento à mudança entregue e o efeito a jusante sobre o volume de suporte, o tempo de treinamento e as taxas de erro e de retrabalho, e definem limiares que disparam ação quando uma métrica escorrega. A reutilização do repositório e a qualidade dos estudos são monitoradas, para que os líderes vejam o retorno que a pesquisa produz em vez de presumi-lo.
- Nível 5, Orquestrar: A pesquisa é um ciclo contínuo e triangulado com a análise de dados e a experimentação, fechando do discernimento à mudança entregue ao efeito medido, e é integrada à estratégia de produto e ao planejamento de risco em toda a organização. A pesquisa democratizada roda com segurança dentro de proteções, os achados se compõem e se adaptam à medida que o produto e seus usuários mudam, e a pesquisa demonstravelmente molda a estratégia, não apenas as telas.
Ideias para discussão
- Quanta descoberta é “o bastante” antes de se comprometer com uma construção, e quem tem autoridade para dizer quando vocês aprenderam o suficiente?
- Quando a análise de dados e as entrevistas contam histórias opostas sobre a mesma funcionalidade, como a equipe deve decidir em qual agir?
- Onde fica a linha entre democratizar a pesquisa com responsabilidade e deixar o entusiasmo sem treinamento produzir estudos enviesados em escala?
- Como vocês medem o retorno de um estudo cujo valor é um erro que, por isso, vocês nunca cometeram e nunca poderão apontar?
- Qual é a forma ética de pesquisar com pessoas em crise ou em circunstâncias vulneráveis sem acrescentar ao fardo delas?
- A pesquisa obrigatória com usuários, como nos padrões de serviço do governo, deve ser um portão que pode bloquear um lançamento, e quem a impõe?
Principais conclusões
- A pesquisa existe para reduzir o risco de construir a coisa errada, e é mais barata antes de construir.
- Separem a pesquisa generativa (achar o problema certo) da avaliativa (conferir a solução). Escolham o método a partir da pergunta.
- “Cerca de cinco usuários” acha a maioria dos problemas graves em um segmento por rodada, mas não mede o sucesso nem cobre grupos distintos.
- Escrevam as tarefas como objetivos realistas, perguntem sobre o comportamento passado e projetem contra perguntas indutoras e o viés de confirmação.
- Recrutem participantes que de fato representem os seus usuários, inclusive pessoas com deficiência e de difícil alcance, ou seus achados são discretamente falsos.
- Sintetizem em decisões ordenadas, não em slides. O teste é se uma decisão de fato mudou.
- Triangulem a pesquisa qualitativa com a análise de dados e a experimentação e capturem os achados num repositório compartilhado para que o aprendizado se componha.
Referências e leitura complementar
- Erika Hall, Just Enough Research
- Steve Krug, Rocket Surgery Made Easy
- Jakob Nielsen, Usability Engineering
- Mike Kuniavsky, Observing the User Experience
- Steve Portigal, Interviewing Users
- Tomer Sharon, Validating Product Ideas: Through Lean User Research
- Hugh Beyer and Karen Holtzblatt, Contextual Design
- Donna Spencer, Card Sorting: Designing Usable Categories
- Kathy Baxter, Catherine Courage, and Kelly Caine, Understanding Your Users
- Kate Towsey, Research That Scales: The Research Operations Handbook
- Nielsen Norman Group, articles on usability testing, sample size, and research methods
- UK Government Digital Service, Service Manual: user research guidance