5.8 Investigación de diseño y pruebas de usabilidad
Descripción y motivación
La investigación con usuarios es la disciplina de conocer a las personas para quienes se construye: sus objetivos, contextos, tareas y los obstáculos que les frenan. Su valor esencial es reducir el riesgo. El error más caro en software no es un fallo técnico ni una fecha de entrega incumplida; es construir bien la cosa equivocada y descubrir después del lanzamiento que nadie la necesitaba o que nadie sabía usarla. La investigación compra esa reducción de riesgo a bajo coste, antes de invertir esfuerzo de ingeniería en una dirección que resulta ser la incorrecta. El capítulo 5.1 sienta las bases de la experiencia de usuario; este capítulo profundiza en los dos motores que mantienen esas bases sólidas: la investigación generativa, que señala qué construir, y la investigación evaluativa, que verifica si lo construido realmente funciona.
En equipos grandes, la stakes se multiplica. Cuando varios equipos desparraman su trabajo en un mismo producto, cada uno arriesga apuestas sobre los usuarios cada sprint, y sin un hábito de investigación compartido, esas apuestas no son más que opiniones disfrazadas de certeza. Un flujo constante y modesto de evidencia da a todos la misma realidad sobre la que debatir, de modo que las discusiones terminan con «vayamos a ver a unos cuantos usuarios» en lugar de con quien tenga mayor rango o voz más fuerte. La investigación también viaja: un buen estudio puede corregir las suposiciones de una docena de equipos a la vez, si se captura y se comparte con eficacia.
En el sector empresarial y en el público, la exigencia es aún mayor. El software empresarial suele tener usuarios cautivos que no pueden irse, de modo que las herramientas inútiles se pagan en errores, formación y horas perdidas, no en la fuga de clientes que se vería en un panel de métricas. Los servicios públicos llegan a toda la ciudadanía, incluidas personas en crisis, con teléfonos antiguos, con baja confianza digital o sin alternativa. Muchos estándares nacionales de servicios digitales hacen obligatoria la investigación con usuarios precisamente por esta razón, porque un formulario que nadie termina niega a las personas prestaciones que les corresponden por derecho. Aquí la investigación no es un capricho. Es la forma de honrar una promesa pública.
Principios clave
- La investigación reduce el riesgo de construir lo equivocado; es más económica antes de construir, no después.
- La investigación generativa encuentra el problema correcto; la evaluativa comprueba la solución. Se necesitan ambas.
- Observa lo que la gente hace, no solo lo que dice; la preferencia declarada y el comportamiento real divergen.
- Los métodos cualitativos explican el porqué; los cuantitativos dimensionan el cuántos. Úsalos en conjunto.
- Lo pequeño y continuo supera a lo esporádico y pesado. Unos cuantos usuarios cada semana enseñan más que un gran estudio al año.
- Los hallazgos son tan representativos como tus participantes, así que recluta con intención, incluyendo personas con discapacidad y colectivos de difícil acceso.
- Un hallazgo que queda en la diapositiva de un solo equipo se pierde. Captura la investigación para que toda la organización pueda reutilizarla.
- El sesgo se cuela a través de preguntas orientadoras y de una síntesis esperanzadora; diseña para contrarrestarlo de forma deliberada.
Recomendaciones
Distingue la investigación generativa de la evaluativa
Sé explícito sobre qué pregunta haces, porque los métodos difieren. La investigación generativa (o de descubrimiento) es abierta y explora un espacio de problemas antes de tener una solución: ¿qué están intentando realmente lograr las personas? ¿Dónde duele la experiencia actual? ¿Qué trucos de contorneo inventan? La investigación evaluativa prueba un diseño concreto frente a una tarea: ¿pueden completarla y dónde se traban? Confundir ambas desperdicia las dos. Ejecutar una sesión de pruebas de usabilidad rigurosamente guionizada cuando aún no se entiende el problema produce respuestas pulidas para la pregunta equivocada, mientras que una charla sin estructura cuando se necesita validar un flujo de pago deja al equipo adivinando. Plantea la pregunta de investigación primero, luego elige el método, y canaliza los hallazgos generativos hacia el descubrimiento de producto (capítulo 10.14), donde realmente se da forma a la hoja de ruta.
Adapta el método a la pregunta
No existe un método universal, solo adecuaciones. Las entrevistas con usuarios sacan a la luz motivaciones, modelos mentales e historias, y son la herramienta de cabecera para el descubrimiento. La indagación contextual, donde se observa a las personas en su trabajo real y en su propio entorno, revela los contorneos y las interrupciones que nadie menciona en una sala de reuniones. Las encuestas miden actitudes y frecuencias en una población amplia, pero no pueden explicar las razones subyacentes, y castigan sin piedad un diseño de preguntas descuidado. La ordenación por tarjetas y la prueba de arbolado derivan y validan la arquitectura de la información a partir de los modelos mentales de los usuarios: en la ordenación por tarjetas se pide a las personas que agrupen y nombraran conceptos, y en la prueba de arbolado se comprueba si pueden encontrar las cosas en una estructura propuesta. Los estudios de diario capturan comportamientos que se despliegan a lo largo de días o semanas, como la incorporación inicial o la formación de hábitos, algo que ninguna sesión puntual puede ver. Una heurística sencilla: usar entrevistas e indagación contextual para entender a las personas, ordenación por tarjetas y prueba de arbolado para estructurar la información, encuestas y diarios de usuario para ver a través del tiempo y a escala, y pruebas de usabilidad para comprobar un diseño.
Realiza pruebas de usabilidad pronto, a menudo y en pequeñas dosis
Las pruebas de usabilidad son el método evaluativo de mayor retorno, y se pueden iniciar con bocetos en papel mucho antes de que exista código. La heurística bien conocida dice que unas cinco personas por ronda descubren la mayoría de los problemas graves y evidentes de usabilidad, de modo que conviene realizar tres rondas de cinco mientras el diseño evoluciona en lugar de un gran estudio de quince al final. Comprended, sin embargo, los límites de esa heurística. Cinco personas bastan solo para un grupo homogéneo que descubre problemas grandes; no miden tasas de éxito, no cubren segmentos de usuarios distintos (cada grupo significativamente diferente necesita su propio puñado) y no detectan problemas raros pero graves. Elegid pruebas moderadas cuando se quiera indagar en el razonamiento, adaptarse sobre la marcha y gestionar tareas complejas o sensibles, y pruebas no moderadas cuando se busque velocidad, volumen, alcance geográfico y menor coste en flujos sencillos. La mayoría de los equipos maduros realizan ambas: pruebas moderadas para entender, no moderadas para confirmar a escala.
Redacta tareas y preguntas que no orienten al testigo
Tu estudio es tan fiable como su protocolo, y la forma más rápida de arruinarlo es dejar entrever la respuesta que se desea. Da a los participantes objetivos realistas, no instrucciones: di «acabas de mudar de casa y necesitas actualizar tu dirección» en lugar de «pulsa el botón Editar perfil y cambia la dirección». Pregunta por el comportamiento pasado, no por intenciones futuras, porque «¿lo usarías?» produce de forma fiable mentiras corteses, mientras que «cuéntame la última vez que hiciste esto» produce hechos. Evita preguntas que asumen su propia conclusión, y mantente alerta ante el sesgo de confirmación, esa tendencia humana a notar y retener la evidencia que respalda lo que ya se cree. La persona que diseñó el producto no debe guiar en silencio a los participantes hacia el éxito, y el equipo que observa debe registrar lo que ocurrió antes de debatir su significado. Cuando se separa el diseño y la comunicación de las tareas del diseño del propio producto (capítulo 5.4), la señal que se obtiene es más nítida.
Recluta participantes que realmente representen a tus usuarios
Los hallazgos heredan el sesgo de la selección. Si solo se prueba con voluntarios seguros, conectados y cómodos con la tecnología, se entregará algo que funciona a la perfección para personas que apenas necesitaban ayuda y fracasa con quienes más la necesitaban. Defini los segmentos y luego recluta en función de ellos de forma deliberada, incluyendo personas con discapacidad que dependen de tecnología de apoyo (capítulo 5.3) y colectivos de difícil acceso como personas en crisis, personas con baja confianza digital, usuarios mayores y quienes disponen de conexiones lentas o dispositivos antiguos. Llegar a estos participantes requiere más esfuerzo y a menudo la cooperación con organizaciones comunitarias, incentivos adecuados y logística flexible, pero omitirlo no hace que esos usuarios desaparezcan; solo traslada el descubrimiento a producción, donde es mucho más caro y mucho más dañino. Filtre con cuidado para obtener miembros reales de un segmento en lugar de probadores profesionales que explotan los incentivos.
Sintetiza los hallazgos en decisiones, no solo en informes
Las observaciones crudas no son un hallazgo. El trabajo de síntesis consiste en convertir un montón de notas de sesión en un número pequeño de decisiones que el equipo pueda ejecutar. La agrupación por afinidad, que clustra observaciones individuales en temas, es el movimiento estándar para hacer patrones visibles entre sesiones. En estudios centrados en entrevistas, un análisis temático ligero mantiene la honestidad sobre qué temas están realmente respaldados por los datos. Integra los patrones duraderos en los modelos compartidos del capítulo 5.1, personas y mapas de recorrido basados en evidencia, para que el conocimiento se acumule en lugar de evaporarse. El criterio de una buena síntesis es simple: ¿cambió una decisión? Un estudio que produce una presentación impecable y no altera ningún elemento de la hoja de ruta es teatro. Cierra cada estudio con una lista breve y priorizada de hallazgos y una acción recomendada para cada uno.
Triangula la investigación cualitativa con la analítica y la experimentación
La investigación cualitativa y los datos cuantitativos responden las dos mitades de la misma pregunta, y cada uno cubre el punto ciego del otro. La investigación explica por qué las personas se comportan como lo hacen, pero solo ve el puñado de gente en la sala; la analítica y la experimentación (capítulo 7.4) ven a toda la población, pero no pueden explicar la motivación ni detectar los problemas de quienes nunca llegaron a ser usuarios. Úsalos como un bucle: la analítica muestra una caída, la investigación la explica, un rediseño la aborda, y un experimento mide si la solución movió el número. Cuando la señal cualitativa y la cuantitativa se contradicen, tratad esa contradicción como una pista en lugar de una molestia, porque normalmente uno de los dos está midiendo algo que no se había consciente de estar midiendo. Ninguna fuente es la jefa de la otra; la decisión nace de leerlas juntas.
Crea operaciones de investigación para que la investigación escale
En cuanto más de dos equipos realizan investigación, el cuello de botella deja de ser el método y pasa a ser la logística: reclutamiento, programación, consentimiento, incentivos, almacenamiento de notas y encontrar el estudio del trimestre anterior antes de que alguien lo repita. Las operaciones de investigación (ResearchOps) son la práctica de hacer que esa maquinaria sea fiable. Invierte en un repositorio de hallazgos buscable donde los resultados estén etiquetados, descubribles y reutilizables entre equipos; un sistema de gestión de participantes que respete el consentimiento, la privacidad y la frecuencia de contacto; y un ritmo regular de investigación para que los estudios sean un hábito constante y no una carrera contra el reloj. Democratizar la investigación, dejar que personas no investigadoras ejecuten algunos estudios, merece la pena, pero solo con salvaguardas: plantillas, formación y revisión, de modo que se incremente el volumen de aprendizaje sin aumentar el volumen de protocolos defectuosos y conclusiones sesgadas.
Compromisos: ventajas e inconvenientes
| Método | Ideal para | Ventajas | Inconvenientes |
|---|---|---|---|
| Entrevistas con usuarios | Descubrimiento, motivaciones | Profundidad en el porqué, flexibilidad, bajo coste de inicio | Muestra pequeña, propensa al sesgo del entrevistador |
| Indagación contextual | Comportamiento en el mundo real | Revela contorneos y contexto | Demanda tiempo, difícil de programar |
| Encuestas | Actitudes a escala | Gran muestra, cuantificable | No explica el porqué, fácil de redactar mal |
| Ordenación por tarjetas y prueba de arbolado | Arquitectura de la información | Arraiga la estructura en modelos mentales | Alcance estrecho, requiere análisis cuidadoso |
| Estudios de diario | Comportamiento en el tiempo | Captura patrones longitudinales | Alta tasa de abandono, esfuerzo del participante |
| Pruebas de usabilidad moderadas | Comprender un diseño | Indagación, adaptabilidad, riqueza | Más lentas, más caras, exigentes en programación |
| Pruebas de usabilidad no moderadas | Confirmar a escala | Rápidas, económicas, amplia cobertura geográfica | Sin seguimiento, limitadas en tareas complejas |
La tensión central es entre profundidad y escala, y su resolución está en secuenciar, no en elegir. Se usan métodos profundos, cualitativos y de muestra pequeña para entender y generar hipótesis, y luego se emplean métodos amplios y cuantitativos para dimensionar y confirmarlas. Una segunda tensión es entre velocidad y rigor: la investigación continua y ligera mantiene al equipo aprendiendo cada semana, pero esa misma velocidad que la hace valiosa facilita el recorte en el reclutamiento y el protocolo. Resuélvela acoplando el rigor a la reversibilidad: dedica cuidado metodológico real a decisiones que son caras de deshacer (flujos centrales, arquitectura de la información, apuestas de plataforma) y muévete rápido y con libertad en los detalles que se pueden cambiar el próximo sprint.
Preguntas para debatir con tu equipo
Cuando hacemos una apuesta de producto, ¿cuál es la investigación más pequeña que cambiaría nuestra decisión y estamos dispuestos a realizarla antes de comprometernos? A los equipos les gusta la investigación en principio y la omiten bajo presión de plazo, de modo que la verdadera pregunta es si la evidencia tiene alguna autoridad sobre la hoja de ruta. Decide de antemano qué contaría como evidencia que desmiente la hipótesis, porque un estudio que se ignorará con independencia del resultado es un desperdicio del tiempo de todos y una forma de teatro. Esto importa más en decisiones difíciles de revertir, donde una semana de descubrimiento es un sacrificio mínimo frente a meses de construir la cosa equivocada. Traed una decisión actual y nombred, en voz alta, el hallazgo que haría que cambiarais de rumbo. Si ningún hallazgo podría cambiarla, no estáis haciendo investigación: estáis recabando reassurance, y debéis comprometeros con honestidad o volver a abrir la decisión.
¿Las personas con quienes probamos se parecen realmente a las que usan el producto, especialmente a quienes más dificultades tienen? Es cómodo reclutar voluntarios seguros, conectados y disponibles, y esa comodidad produce una lectura halagadora y falsa de lo usable que es el producto de verdad. Los usuarios que más necesitan que el software funcione bien (personas con discapacidad, personas en crisis, personas con baja confianza digital) suelen ser los más difíciles de reclutar, y por eso desaparecen silenciosamente de la muestra si no se lucha por ellos. Extrayed la demografía de participantes de vuestros últimos tres estudios y ponedla junto a vuestra base real de usuarios o a vuestras obligaciones como servicio público. Si se inclina hacia usuarios fáciles de alcanzar, la confianza está mal puesta, y conviene reparar la canal de reclutamiento, aliarse con organizaciones comunitarias y ajustar los incentivos antes de confiar en otra ronda de hallazgos.
¿Dónde viven los hallazgos de investigación de nuestro equipo y podría otro equipo encontrarlos y reutilizarlos seis meses después? En una organización grande, la misma pregunta se investiga una y otra vez porque nadie pudo encontrar la respuesta que el primer equipo ya pagó, lo cual es un desperdicio puro disfrazado de diligencia. Define quién es el propietario del repositorio de hallazgos, cómo se etiquetan y resumen los estudios, y cuál es la redacción mínima viable para que capturar un hallazgo sea lo bastante ágil como para que la gente realmente lo haga. Considerad qué ocurre con el consentimiento y la privacidad de los participantes a medida que los hallazgos se reutilizan y comparten, porque reutilizar sin cuidado es un problema de cumplimiento y de confianza. Traed una decisión reciente y tratad de rastrear la evidencia que la sustenta. Si no podéis encontrar el estudio en menos de un par de minutos, vuestra investigación se evapora más rápido de lo que la producís.
Cuando citamos la regla de «unas cinco personas», ¿cuántos segmentos distintos atiende realmente este producto y estamos probando con una muestra real de cada uno? La heurística de cinco usuarios se convierte en trampa cuando un producto atiende varios grupos de usuarios significativamente diferentes, porque cinco participantes de un grupo no dicen nada sobre los demás, y sin embargo el número se cita como si una sola ronda resolviera el asunto para todos. En un equipo grande que despliega en un producto compartido, los segmentos se multiplican rápidamente: distintos roles, regiones, dispositivos, necesidades de accesibilidad y niveles de pericia, y cada grupo significativamente distinto necesita su propio puñado. La presión contraria es el coste y el calendario, ya que probar cada segmento en cada ronda es caro, de modo que decidid qué segmentos concentran más riesgo, cubridlos en cada ronda y rotad el resto. Traed el mapa de segmentos real y el número de participantes por segmento en las rondas recientes, y sé sincero sobre los grupos que nunca habéis observado. En contextos empresariales y del sector público, donde los usuarios cautivos y las obligaciones de servicio público significan que el segmento descuidado no puede simplemente irse, un segmento no probado es una población a la que se está fallando en silencio, y esa carencia debe figurar en el plan como cobertura explícita y no como un estadístico diluido.
¿Quién puede ejecutar un estudio aquí y qué impide que un entusiasta sin formación genere confiado disparate a escala? Democratizar la investigación permite que más equipos aprendan más rápido, pero sin plantillas, formación y revisión también escala protocolos sesgados, preguntas orientadoras y síntesis esperanzadora, de modo que el volumen de aprendizaje y el volumen de conclusiones defectuosas crecen a la par. La tensión es entre throughput y confianza: si todo pasa por unas pocas investigadoras se convierten en cuello de botella; si se abren las puertas sin salvaguardas se inunda la organización de hallazgos sobre los que nadie debería actuar. Decidid qué tipos de estudio es seguro delegar (por ejemplo, una prueba de tarea no moderada rápida) y cuáles exigen mano experta (temas sensibles, participantes vulnerables o apuestas de arquitectura de la información) , y traed las plantillas, el paso de revisión y una auditoría honesta de los estudios autoservicio recientes para ver cuántos aguantarían un escrutinio. En una gran empresa o un organismo público, sumad el ángulo de la contratación y la privacidad: la herramienta de investigación compartida suele comprarse, y una plataforma de autoservicio que permite a cualquiera contactar con participantes sin seguimiento de consentimiento es un incidente de cumplimiento a la espera de ocurrir, de modo que las salvaguardas son tanto un asunto de manejo legal de datos como de calidad metodológica.
Cuando nuestra analítica y nuestras entrevistas cuentan historias opuestas sobre la misma función, ¿cómo decide este equipo a cuál hacer caso? Las señales cualitativas y cuantitativas responden las dos mitades de una pregunta, y tratar una contradicción entre ellas como una molestia que se resuelve por jerarquía es tirar por la borda la pista más útil que se tiene, porque normalmente una de las fuentes está midiendo algo que no se había consciente de estar midiendo. En una organización grande, el riesgo es el tribalismo: un equipo de datos que solo confía en los paneles y un equipo de investigación que solo confía en las sesiones, cada uno desestimando al otro en lugar de leerlos juntos. Traed una discrepancia real y reciente, la caída que muestra la analítica junto a las razones que da la investigación, y recorred el bucle: la analítica muestra dónde, la investigación explica por qué, y un experimento mide si una solución movió el número. En contextos empresariales y del sector público, donde una métrica puede orientar la financiación o un compromiso público, decidid de antemano quién arbitra cuando las dos fuentes discrepan y qué evidencia cierra el debate, para que la decisión descanse en una lectura triangulada y no en la voz más alta de la sala.
Perspectiva por sector
Startup. Con un puñado de personas y sin margen para desperdiciar, tratad la investigación como el seguro más barato que podéis comprar, no como una fase. Que un fundador realice cinco sesiones moderadas con prototipos en papel antes de escribir mucho código, enmarcando las tareas como objetivos en lugar de instrucciones, y dejad que lo que se observe mate o redirija la idea mientras todavía son bocetos. Saltad el repositorio y el panel; el punto es aprender con suficiente velocidad para evitar construir la cosa equivocada.
Pequeña empresa. Probablemente no se cuente con una investigadora dedicada y el presupuesto es ajustado, de modo que apoyaos en herramientas de prueba no moderada de bajo coste y en entrevistas ligeras en lugar de una función de investigación dotada de personal. Cuando se compre software de pruebas de usabilidad, elegid herramientas que gestionen el reclutamiento y el consentimiento por uno, porque construir esa maquinaria a escala propia rara vez merece la pena. Probá los pocos flujos que hacen o pierden un cliente, y sed disciplinados en redactar tareas que no orienten al testigo, porque un protocolo defectoso desperdicia el poco presupuesto que se tiene.
Empresarial. Con muchos equipos que despliegan en productos compartidos, la restricción es la gobernanza: un repositorio de hallazgos buscable, un panel de participantes gestionado con seguimiento de consentimiento y un ritmo de investigación para que los estudios sean un hábito y no una carrera. Democratice la investigación dentro de salvaguardas de plantillas, formación y revisión para que el volumen escale sin escalar protocolos defectuosos, y aseguraos de que los hallazgos estén etiquetados y sean auditables para que dos equipos no paguen dos veces por responder la misma pregunta. Tratad los datos de participantes como regulados: la retención, el consentimiento y la frecuencia de contacto requieren política.
Sector público. Muchos estándares nacionales de servicios digitales hacen obligatoria la investigación con usuarios y la someten a evaluación, de modo que tratadla como una puerta que un servicio debe superar, con evidencia. Las normas de contratación configuran las herramientas y los proveedores de reclutamiento, la transparencia implica documentar con quiénes se probó y qué se encontró, y la rendición de cuentas pública exige reclutar a los usuarios más difíciles de alcanzar, incluyendo participantes que necesitan asistencia digital y personas con discapacidad, porque un servicio que los excluye niega a las personas derechos que les corresponden. Llevad registros claros de consentimiento y método para que un evaluador, un auditor o el público pueda ver que la investigación fue real.
Ejemplos
Startup. Una startup de seis personas que construía software de gastos para autónomos estaba convencida de que la función decisiva era el escaneo automático de recibos, y ya había construido una versión rudimentaria. Antes de invertir más, dos fundadores realizaron cinco sesiones moderadas de usabilidad con autónomos reales usando prototipos en papel, enmarcando las tareas como objetivos («anota el café que acabas de descontar») en lugar de instrucciones. Cuatro de los cinco ignoraron por completo el escaneo y escribieron a mano las cantidades, porque su verdadera ansiedad no era la velocidad de entrada de datos, sino si un gasto sobreviviría a una inspección fiscal. El equipo pivotó el producto en torno a la categorización a prueba de auditoría y un rastro claro en papel, realizó dos rondas más pequeñas mientras iteraba y transformó una prueba gratuita estancada en suscriptores de pago, todo por el coste de una semana de bocetos y conversaciones.
Empresarial. Una empresa logística global que estandarizaba el software de almacenes entre sedes creó una función permanente de operaciones de investigación para mantener a decenas de equipos de producto en línea. Construyeron un repositorio de hallazgos etiquetado, un panel gestionado de personal de almacén que había consentido sesiones periódicas y un ritmo de investigación quincenal. Cuando dos equipos propusieron independientemente rediseñar el mismo flujo de escaneo, una búsqueda en el repositorio reveló una indagación contextual del trimestre anterior que mostraba que las guantes y las condiciones de cámara fría, no el diseño de la pantalla, eran la causa de la mayoría de los errores de escaneo. Ese único hallazgo reutilizado redirigió a ambos equipos hacia zonas de toque más grandes e interacciones compatibles con guantes, evitó un descubrimiento duplicado y redujo de forma medible los errores de escaneo tras su lanzamiento.
Sector público. Un servicio nacional de salud que rediseñaba su servicio de cita médica trató la investigación con usuarios como obligatoria según su estándar de servicio digital, no como opcional. Junto a pruebas de usabilidad moderadas con una muestra demográficamente amplia, el equipo realizó sesiones con asistencia digital con personas que normalmente dependían de un familiar o de un asistente de biblioteca, y reclutó participantes con discapacidad que usaban lectores de pantalla y control por conmutador (capítulo 5.3) a través de alianzas con organizaciones de ayuda. La prueba reveló que el jerga clínica en los títulos de sección hacía que usuarios mayores y de menor confianza abandonaran antes de llegar a una barrera real. Reestructurar el contenido en torno a los objetivos en lenguaje claro de los pacientes, y luego confirmar la mejora con un estudio no moderado a escala y una comparación de analítica en vivo (capítulo 7.4), incrementó las citas autogestionadas con éxito y redujo la carga del centro de llamadas, mejorando tanto el coste de atención como la equidad de acceso.
Caso empresarial: motivaciones, retorno y coste total
El retorno de la investigación procede de tres palancas. Primera, el ahorro evitado: detectar una dirección errónea durante una semana de descubrimiento en lugar de tras un trimestre de ingeniería es el mayor ahorro y el que menos se cuenta, precisamente porque el trabajo desperdiciado nunca llega a producirse y, por tanto, nunca aparece en un informe. Segunda, mayor éxito: más usuarios completando tareas valiosas, lo que se ve como conversión en productos de consumo y como productividad y menos errores en entornos empresariales donde los usuarios son cautivos. Tercera, menor coste de atención: los servicios usables generan menos incidencias de soporte, menos formación y menos errores downstream que corregir.
El coste total de propiedad debe ponderar el coste de hacer investigación frente al coste de no hacerla. Los costes de hacerla son visibles y modestos: investigadoras, reclutamiento e incentivos, herramientas, un repositorio y tiempo en la agenda. Los costes de no hacerla son mayores, pero se dispersan en otros presupuestos: transacciones abandonadas, incidencias de soporte, jornadas de formación, rediseños tardíos y caros, lanzamientos fallidos y, en el sector público, la exclusión de ciudadanas y la exposición legal y reputacional que sigue. Porque esos costes se esconden en soporte, formación y operaciones en lugar de en la línea de producto, la dirección los subestima de forma rutinaria, que es justo por eso la investigación parece opcional justo hasta que un lanzamiento fracasa.
Para construir el caso, atad la investigación a los números que la dirección ya vigila: tasas de finalización y conversión, coste por transacción, volumen de soporte, tiempo de formación y tasas de error y retrabajo. Ejecuted un pequeño estudio antes y después instrumentado en un flujo real, mostrad el movimiento y extrapolad a todo el portafolio. Presentad la investigación como reducción de riesgo en decisiones irreversibles, el lenguaje que resuena con los interlocutores de finanzas y gobernanza que quizá nunca lean un informe de usabilidad, pero sí entienden una apuesta que puede salir mal.
Antipatrones y trampas
- Teatro de investigación: estudios que se ejecutan para justificar una decisión ya tomada, con hallazgos silenciosamente ignorados cuando incómodos.
- Orientar al testigo: tareas y preguntas que dejan entrever la respuesta deseada, generando datos halagadores que no significan nada.
- Síntesis con sesgo de confirmación: escuchar solo las observaciones que encajan con el plan y descartar el resto.
- La falacia de las cinco personas: tratar «unas cinco personas» como ley universal, ignorando que asume un solo segmento y solo encuentra problemas graves, no tasas de éxito.
- Reclutamiento de conveniencia: probar con quien sea fácil de alcanzar, de modo que las personas con discapacidad y los colectivos de difícil acceso desaparecen de la muestra.
- Fiar de la preferencia declarada: creer el «sí, lo usaría» en lugar de observar lo que las personas realmente hacen.
- Panteones de hallazgos: resultados enterrados en las diapositivas de un solo equipo, de modo que la misma pregunta se investiga una y otra vez.
- Democratización sin salvaguardas: dejar que cualquiera ejecute estudios sin plantillas ni revisión, escalando protocolos sesgados y conclusiones frágiles.
- Tribalismo cualitativo-cuantitativo: elegir una fuente de datos favorita y desestimar la otra en lugar de triangular.
Modelo de madurez
- Nivel 1, Iniciar: La investigación es esporádica o inexistente, y las decisiones se apoyan en opiniones y jerarquía. Las pruebas de usabilidad, si ocurren, son un acto puntual y reactivo antes del lanzamiento con quien se tenga a mano, y los hallazgos rara vez cambian nada.
- Nivel 2, Desarrollar: Algunos equipos realizan pruebas de usabilidad y entrevistas ocasionales, pero el reclutamiento es de conveniencia, los protocolos son informales y los hallazgos viven en presentaciones dispersas. La práctica varía enormemente de un equipo a otro, y la investigación es una fase que se recorta bajo presión de plazo.
- Nivel 3, Estandarizar: La investigación generativa y la evaluativa están documentadas y se ejecutan de forma continua entre equipos, alimentando la priorización a través de un proceso compartido. El reclutamiento apunta a segmentos reales, incluyendo personas con discapacidad y colectivos de difícil acceso; existe un repositorio de hallazgos buscable, la síntesis produce decisiones priorizadas y las operaciones de investigación gestionan el ritmo, las plantillas y los participantes a nivel de organización.
- Nivel 4, Gestionar: El programa de investigación se mide frente a líneas base. Los equipos rastrean la cobertura de segmentos de usuarios, las tasas de éxito y finalización de tareas, el tiempo desde el hallazgo hasta el cambio desplegado y el efecto descendente en el volumen de soporte, el tiempo de formación y las tasas de error y retrabajo, y establecen umbrales que disparan la acción cuando una métrica se desvía. La reutilización del repositorio y la calidad de los estudios se monitorizan, de modo que la dirección puede ver el retorno que la investigación produce en lugar de darlo por supuesto.
- Nivel 5, Orquestar: La investigación es un bucle continuo y triangulado con la analítica y la experimentación, que cierra el ciclo de hallazgo a cambio desplegado a efecto medido, y está integrado con la estrategia de producto y la planificación de riesgos a nivel de organización. La investigación democratizada se ejecuta de forma segura dentro de salvaguardas, los hallazgos se acumulan y se adaptan a medida que el producto y sus usuarios evolucionan, y la investigación da forma a la estrategia de forma demostrable, no solo a las pantallas.
Ideas para el debate
- ¿Cuánto descubrimiento es «suficiente» antes de comprometerse con una construcción y quién tiene la autoridad de decir que ya se ha aprendido lo bastante?
- Cuando la analítica y las entrevistas cuentan historias opuestas sobre la misma función, ¿cómo debería el equipo decidir en cuál actuar?
- ¿Dónde está el límite entre democratizar la investigación responsablemente y dejar que el entusiasmo sin formación genere estudios sesgados a escala?
- ¿Cómo se mide el retorno de un estudio cuyo valor es un error que por tanto nunca se cometió y nunca se puede señalar?
- ¿Cuál es la forma ética de investigar con personas en crisis o en circunstancias vulnerables sin aumentar su carga?
- ¿Debe la investigación obligatoria con usuarios, como en los estándares de servicios públicos, ser una puerta que pueda bloquear un lanzamiento, y quién la aplica?
Conclusiones clave
- La investigación existe para reducir el riesgo de construir lo equivocado, y es más económica antes de construir.
- Distingue la investigación generativa (encontrar el problema correcto) de la evaluativa (comprobar la solución); elige el método a partir de la pregunta.
- «Unas cinco personas» detecta la mayoría de problemas graves en un segmento por ronda, pero no mide el éxito ni cubre grupos distintos.
- Redacta las tareas como objetivos realistas, pregunta por el comportamiento pasado y diseña para contrarrestar las preguntas orientadoras y el sesgo de confirmación.
- Recluta participantes que representen de verdad a tus usuarios, incluidas personas con discapacidad y colectivos de difícil acceso, o tus hallazgos serán falsos en silencio.
- Sintetiza en decisiones priorizadas, no en presentaciones; el criterio es si una decisión cambió de verdad.
- Triangula la investigación cualitativa con la analítica y la experimentación, y captura los hallazgos en un repositorio compartido para que el aprendizaje se acumule.
Referencias y lecturas complementarias
- Erika Hall, Just Enough Research
- Steve Krug, Rocket Surgery Made Easy
- Jakob Nielsen, Usability Engineering
- Mike Kuniavsky, Observing the User Experience
- Steve Portigal, Interviewing Users
- Tomer Sharon, Validating Product Ideas: Through Lean User Research
- Hugh Beyer y Karen Holtzblatt, Contextual Design
- Donna Spencer, Card Sorting: Designing Usable Categories
- Kathy Baxter, Catherine Courage y Kelly Caine, Understanding Your Users
- Kate Towsey, Research That Scales: The Research Operations Handbook
- Nielsen Norman Group, artículos sobre pruebas de usabilidad, tamaño de muestra y métodos de investigación
- UK Government Digital Service, Service Manual: guía de investigación con usuarios