Qué es la prueba de Thurstone: Una Exploración Profunda de la Medición de Actitudes y sus Fundamentos Psicométricos

Imaginemos por un momento a Ana, una joven investigadora social con una pasión por entender la psique humana. Ana se encuentra frente a un desafío recurrente en su campo: ¿cómo cuantificar algo tan etéreo y subjetivo como una actitud? ¿Cómo podemos decir con cierta certeza que una persona tiene una actitud más favorable o desfavorable hacia, digamos, el cambio climático, la inmigración o un nuevo producto, de una manera que sea medible y comparable? No se trata solo de preguntar si les gusta o no; se busca una escala de medición que capte los matices, que pueda diferenciar grados de favorabilidad con una precisión casi matemática. En su búsqueda de herramientas robustas, Ana inevitablemente se topa con un pilar fundamental de la psicometría: la prueba de Thurstone. Y es precisamente aquí, en el corazón de este método, donde encontramos una respuesta sofisticada y profundamente influyente a su dilema.

En esencia, la prueba de Thurstone es un método psicométrico desarrollado por Louis Leon Thurstone en los años 20 para medir actitudes. A diferencia de otras escalas que surgieron más tarde, su gran contribución reside en la ambición de crear una verdadera escala de intervalo para los constructos psicológicos, es decir, una escala donde las distancias entre los puntos no solo tienen un orden, sino que también representan diferencias iguales en la actitud subyacente. Piensa en ello como el paso de simplemente decir «más grande» o «más pequeño» a poder afirmar «dos veces más grande» o «cinco unidades más grande». Para las actitudes, esto significó un avance revolucionario que sentó las bases para gran parte de la medición social y psicológica que conocemos hoy en día.

La genialidad de Thurstone radica en su atrevida propuesta de aplicar los principios de la psicofísica (que medían sensaciones físicas como el peso o la luminosidad) a fenómenos puramente psicológicos como las actitudes. Su método implica un proceso meticuloso de selección de ítems, donde un panel de jueces expertos evalúa declaraciones sobre un tema y les asigna valores en un continuo de favorabilidad. El resultado es una escala que permite a los investigadores asignar un valor numérico a la actitud de un individuo, no solo indicando la dirección (favorable o desfavorable), sino también, y esto es clave, la magnitud de esa actitud. Es una herramienta potente que, aunque compleja en su construcción, ofrece una profundidad y un rigor que pocas otras escalas pueden igualar en ciertos contextos.

Table of Contents

Historia y Orígenes de la Escala de Thurstone: Forjando la Medición de Actitudes

Para comprender cabalmente la prueba de Thurstone, es imprescindible remontarse a los albores de la psicometría, a una era en la que la psicología buscaba desesperadamente establecerse como una ciencia rigurosa. A principios del siglo XX, mientras la física y la química gozaban de métodos de medición precisos, la psicología luchaba por cuantificar conceptos abstractos como la inteligencia, la personalidad o, en nuestro caso, las actitudes.

Fue en este contexto donde emergió la figura de Louis Leon Thurstone (1887-1955), un psicólogo, matemático y pionero en la psicometría estadounidense. Thurstone no era solo un académico; era un visionario. Su insatisfacción con los métodos rudimentarios de medición de la época lo llevó a buscar soluciones más sofisticadas. Observó que gran parte de la investigación en actitudes se basaba en meras clasificaciones ordinales, donde se podía decir que algo era «más» o «menos» que otra cosa, pero no «cuánto más» o «cuánto menos». Este nivel de medición era insuficiente para sus aspiraciones científicas.

Thurstone se inspiró en la psicofísica, la rama de la psicología que estudia la relación entre los estímulos físicos y las sensaciones psicológicas. Figuras como Weber y Fechner habían logrado medir umbrales y diferencias apenas perceptibles en estímulos físicos, estableciendo leyes cuantitativas. Thurstone tuvo la brillante idea de adaptar estos principios a los constructos psicológicos. Si se podía medir la intensidad de una luz o el peso de un objeto con precisión, ¿por qué no las actitudes?

Su trabajo culminó en 1928 con la publicación de su método, que prometía crear una escala de actitud con propiedades de intervalo. Esto significaba que, teóricamente, se podía afirmar que la diferencia en actitud entre dos puntos de la escala era la misma que la diferencia entre otros dos puntos de igual separación numérica. Este fue un salto cualitativo enorme. Antes de Thurstone, las actitudes eran vistas más como fenómenos categóricos u ordinales. Él propuso una forma de tratarlas como variables continuas, con una métrica que permitía operaciones estadísticas más avanzadas y, por ende, conclusiones más robustas.

La perspectiva de Thurstone fue, en su momento, revolucionaria y marcó un antes y un después en la medición de actitudes. Aunque más tarde surgirían otras escalas, como la de Likert, que ofrecían mayor simplicidad en la construcción, la contribución de Thurstone a la teoría de la medición y su búsqueda incansable de la precisión cimentaron un legado perdurable en la psicometría moderna. Es gracias a pioneros como él que hoy podemos abordar la complejidad de las actitudes humanas con herramientas cada vez más sofisticadas.

Fundamentos Teóricos: La Ley del Juicio Comparativo y los Intervalos Igualmente Aparecen

Para entender la sofisticación de la prueba de Thurstone, hay que sumergirse en sus cimientos teóricos, principalmente en la «Ley del Juicio Comparativo» (Law of Comparative Judgment). Este principio es el corazón de su propuesta y lo que le confiere una distinción tan marcada respecto a otras formas de medición de actitudes.

Thurstone partió de la premisa de que cuando las personas juzgan dos estímulos (en este caso, dos declaraciones o ítems de actitud), su juicio no es absoluto, sino relativo. Además, este juicio está influenciado por la posición subjetiva de cada ítem en una escala psicológica latente. Imaginemos que tenemos una serie de afirmaciones sobre un tema, y cada una de estas afirmaciones «activa» un punto específico en la actitud subyacente de una persona. La Ley del Juicio Comparativo postula que la probabilidad de que un ítem sea juzgado como más favorable que otro se relaciona con la distancia entre sus valores escalares en esa dimensión subyacente y la variabilidad de esos juicios.

Lo verdaderamente innovador aquí es la asunción de que las actitudes, aunque son constructos latentes e intangibles, pueden ser conceptualizadas como puntos en un continuo. Y, aún más importante, que es posible estimar las ubicaciones de estos puntos de manera que los intervalos entre ellos sean «igualmente aparentes» o, de hecho, iguales en términos psicológicos. Esto es lo que diferencia a la escala de Thurstone: su objetivo es lograr una «escala de intervalo».

¿Qué significa una escala de intervalo en el contexto de las actitudes? Significa que no solo podemos ordenar las afirmaciones de la menos a la más favorable (ordenación ordinal), sino que también podemos asumir que la diferencia de favorabilidad entre, por ejemplo, una afirmación con valor 3 y una con valor 4 es la misma que la diferencia entre una afirmación con valor 7 y una con valor 8. Esta propiedad es crucial porque permite el uso de operaciones estadísticas más robustas, como calcular medias y desviaciones estándar, lo que no es estrictamente apropiado para escalas meramente ordinales.

Thurstone argumentó que, si bien la percepción individual de un estímulo puede variar (debido a errores de juicio o diferencias personales), al recopilar una gran cantidad de juicios de múltiples individuos, estas variaciones individuales se distribuyen normalmente alrededor de un «valor verdadero» para cada ítem. A partir de estas distribuciones, es posible inferir las ubicaciones de los ítems en una escala de intervalo común. En esencia, está tratando de desentrañar la verdadera posición de cada afirmación en el continuo de actitud, independientemente de la opinión personal de los jueces sobre el tema en sí, centrándose en su juicio sobre la favorabilidad inherente de la afirmación.

Esta búsqueda de la igualdad de intervalos es lo que otorga a la prueba de Thurstone su potencia teórica y su complejidad metodológica. Representa un esfuerzo monumental por llevar la precisión de la medición física al intrincado mundo de la psique humana, aspirando a una forma de cuantificación que va más allá de la simple categorización o el ordenamiento.

Tipos de Escalas de Thurstone: Variantes para la Medición Actitudinal

Aunque la prueba de Thurstone se asocia comúnmente con un método específico, en realidad, Thurstone y sus colaboradores desarrollaron varias técnicas para construir escalas de intervalo de actitudes. Cada una comparte el objetivo de establecer puntos equiespaciados en un continuo, pero difieren en el procedimiento exacto para lograrlo. Las tres principales son el Método de Intervalos Aparentemente Iguales, el Método de Comparaciones Apareadas y el Método de Intervalos Sucesivos.

Método de Intervalos Aparentemente Iguales

Este es, con diferencia, el método más conocido y aplicado de los propuestos por Thurstone. Su nombre describe muy bien su esencia: los jueces intentan clasificar las afirmaciones de manera que las distancias percibidas entre las categorías sean iguales. Es la técnica que exploraremos en detalle en la sección de construcción, pero, en resumen, implica pedir a un panel de jueces que clasifiquen una gran cantidad de declaraciones sobre un tema en un número predefinido de categorías (generalmente 7, 9 o 11), que van desde las más desfavorables a las más favorables, asumiendo que el espacio entre cada categoría es psicológicamente igual. A partir de estas clasificaciones, se calculan valores escalares (generalmente la mediana) y medidas de ambigüedad para cada ítem, lo que permite seleccionar un conjunto final de ítems bien definidos y con valores de escala conocidos.

Método de Comparaciones Apareadas

Este método es teóricamente el más riguroso y directo para derivar valores escalares a partir de la Ley del Juicio Comparativo, pero es extremadamente intensivo en recursos. En lugar de clasificar afirmaciones en categorías, los jueces reciben pares de afirmaciones sobre el tema de actitud y deben indicar cuál de las dos es más favorable. Si hay ‘n’ afirmaciones, se presentan a los jueces n*(n-1)/2 pares únicos para comparar. Por ejemplo, si tenemos 10 afirmaciones, un juez tendría que hacer 45 comparaciones. A partir de la proporción de veces que cada ítem es juzgado como más favorable que otro, se pueden estimar sus valores escalares en el continuo subyacente. Aunque ofrece una precisión teórica muy alta al basarse directamente en los juicios comparativos, su impracticabilidad con un número elevado de ítems (lo cual es común en la fase inicial de desarrollo de una escala) limita su uso a situaciones con un conjunto pequeño de estímulos.

Método de Intervalos Sucesivos

Este método es una variación que busca una mayor flexibilidad y realismo en la suposición de los jueces. A diferencia del método de intervalos aparentemente iguales, no se les pide a los jueces que las distancias entre las categorías sean iguales. En cambio, se les pide que clasifiquen las declaraciones en categorías (por ejemplo, «muy desfavorable», «desfavorable», «neutral», «favorable», «muy favorable») que pueden tener intervalos psicológicos desiguales. Luego, a través de cálculos más complejos basados en la proporción de jueces que clasifican un ítem en una categoría o superior, se estima la ubicación de las «fronteras» entre las categorías y, por ende, los valores escalares de los ítems. Este método intenta ser más realista sobre cómo las personas categorizan, pero sigue buscando la asignación de valores de intervalo a las afirmaciones.

Cada uno de estos enfoques refleja la incansable búsqueda de Thurstone por una medición precisa y con propiedades de intervalo para las actitudes. Si bien el Método de Intervalos Aparentemente Iguales se convirtió en el estándar debido a su equilibrio entre rigor y practicidad, es crucial reconocer la riqueza de su pensamiento y la variedad de herramientas que propuso para abordar el desafío de cuantificar lo subjetivo.

Proceso de Construcción de una Escala de Thurstone (Método de Intervalos Aparentemente Iguales)

La construcción de una escala de Thurstone, particularmente utilizando el Método de Intervalos Aparentemente Iguales, es un proceso laborioso pero extraordinariamente meticuloso y sistemático. Es precisamente esta rigurosidad la que le confiere su estatus de escala de intervalo y su capacidad para captar matices finos en las actitudes. Aquí te detallo cada uno de los pasos:

  1. Generación de Ítems (Afirmaciones o Declaraciones)

    El primer paso y uno de los más cruciales es desarrollar un gran número de afirmaciones relacionadas con la actitud que se desea medir. No estamos hablando de solo diez o veinte; a menudo, se generan cien o incluso más afirmaciones. Estas declaraciones deben variar ampliamente en su grado de favorabilidad, cubriendo todo el espectro desde muy desfavorable hasta muy favorable, pasando por puntos neutrales. Es vital que las afirmaciones sean claras, concisas, inequívocas y que solo expresen una idea a la vez. No deben ser preguntas, sino afirmaciones que reflejen una postura específica sobre el objeto de actitud. Por ejemplo, si medimos la actitud hacia un partido político, podríamos tener afirmaciones como «Este partido es la salvación de nuestro país» (muy favorable), «Este partido tiene algunos puntos buenos y algunos malos» (neutral), o «Este partido es un desastre total» (muy desfavorable).

  2. Selección de Jueces

    Una vez que se tienen las afirmaciones, se recluta un panel de jueces. Este panel no está compuesto por las personas cuya actitud se desea medir, sino por individuos que idealmente son expertos en el tema o, al menos, tienen la capacidad de juzgar objetivamente la «favorabilidad inherente» de cada afirmación, independientemente de su propia opinión personal sobre el asunto. El número de jueces suele ser considerable, a menudo entre 50 y 300, para asegurar la fiabilidad de los juicios. Se les instruye cuidadosamente sobre su tarea, enfatizando que no deben expresar su propia actitud, sino evaluar cuánto apoyo o rechazo representa cada afirmación.

  3. Clasificación de Ítems por Jueces

    A cada juez se le presenta el conjunto completo de afirmaciones y se le pide que las clasifique en un número predeterminado de categorías o pilas (generalmente 7, 9 o 11 categorías), que están ordenadas en un continuo de favorabilidad. La categoría ‘1’ representaría la actitud más desfavorable posible, y la categoría ’11’ (o la más alta) la más favorable. Se les indica explícitamente que intenten que los intervalos entre las categorías sean psicológicamente iguales, es decir, que la diferencia de favorabilidad entre la categoría 1 y 2 sea percibida como igual a la diferencia entre la 5 y la 6, y así sucesivamente. Esta es la premisa clave del método de «intervalos aparentemente iguales». Los jueces colocan cada una de las muchas afirmaciones en la categoría que, según su juicio objetivo, mejor representa el grado de favorabilidad expresado por esa afirmación.

  4. Cálculo de Valores Escalares y Ambigüedad

    Una vez que todos los jueces han clasificado las afirmaciones, se procede a un análisis estadístico por cada ítem. Para cada afirmación, se registra la categoría en la que cada juez la colocó. A partir de estos datos, se calculan dos valores principales para cada afirmación:

    • Valor Escalar (S): Generalmente se utiliza la mediana de las clasificaciones asignadas a esa afirmación por todos los jueces. La mediana representa el punto en la escala de favorabilidad donde el 50% de los jueces clasificó la afirmación por debajo y el 50% por encima. Este valor ‘S’ es la ubicación de la afirmación en la escala final de Thurstone.
    • Medida de Ambigüedad (Q): Se calcula el rango intercuartílico (la diferencia entre el percentil 75 y el percentil 25) de las clasificaciones. Un valor ‘Q’ alto indica que hubo mucha dispersión en los juicios de los jueces para esa afirmación, lo que sugiere que la afirmación es ambigua o no tiene un significado claro y consistente. Por el contrario, un ‘Q’ bajo indica que los jueces estuvieron de acuerdo en la favorabilidad de la afirmación.

    Este paso es fundamental para asegurar que los ítems seleccionados para la escala final sean claros y bien definidos en términos de su favorabilidad.

  5. Selección Final de Ítems

    De las cien o más afirmaciones iniciales, se seleccionan un número mucho menor para la escala final (típicamente entre 10 y 20 ítems). El criterio de selección es doble:

    • Se eligen afirmaciones con valores escalares (S) que estén bien distribuidos a lo largo de todo el continuo de favorabilidad, desde los más bajos hasta los más altos, para representar adecuadamente la gama de actitudes.
    • Se priorizan las afirmaciones con bajos valores de ambigüedad (Q), lo que indica que los jueces estuvieron en gran acuerdo sobre su favorabilidad. Esto garantiza que las afirmaciones seleccionadas sean unívocas y no generen confusión.

    El objetivo es tener un conjunto de ítems que, al ser presentados, cubran de manera eficiente y clara todo el espectro de la actitud a medir.

  6. Aplicación de la Escala

    Una vez construida la escala, esta se presenta a los individuos cuya actitud se desea medir. A diferencia del proceso de clasificación de los jueces, a los encuestados no se les pide que califiquen las afirmaciones, sino que simplemente marquen todas aquellas afirmaciones con las que están de acuerdo o que reflejan su propia actitud. Es una tarea más sencilla y directa para el encuestado.

  7. Puntuación e Interpretación

    La puntuación de la actitud de un individuo es relativamente simple. Se calcula la mediana o la media de los valores escalares (S) de todas las afirmaciones con las que el individuo ha estado de acuerdo. Este número representa la posición del individuo en el continuo de actitud. Por ejemplo, si un individuo está de acuerdo con afirmaciones cuyos valores escalares son 2.1, 3.5, 6.8 y 7.2, su puntuación de actitud sería la mediana o media de esos valores. Esta puntuación, al estar basada en una escala de intervalo, permite comparaciones significativas entre individuos y grupos.

Este proceso, aunque exigente, es la columna vertebral de la validez de una escala de Thurstone, garantizando que cada ítem tenga una posición bien definida y relativamente inambigua en el continuo de actitud.

Ventajas de la Escala de Thurstone: Precisión en la Medición de Actitudes

Aunque su construcción puede ser una empresa compleja, la prueba de Thurstone ofrece una serie de ventajas distintivas que la hacen valiosa en contextos donde la precisión y la naturaleza de intervalo de la medición son primordiales. Estas son algunas de las razones por las que sigue siendo un hito en la psicometría:

  • Mayor Precisión y Sensibilidad: La principal fortaleza de la escala de Thurstone radica en su ambición de lograr una escala de intervalo. Esto significa que puede detectar diferencias más sutiles en las actitudes que las escalas meramente ordinales. Al tener ítems con valores escalares finamente diferenciados, es posible discriminar entre actitudes que están muy cerca en el continuo de favorabilidad. Esto la hace particularmente útil para la investigación que requiere una medición muy granular y detallada.
  • Establecimiento de una Escala de Intervalo: Como ya mencionamos, esta es la joya de la corona. Si se logra construir correctamente, los intervalos entre los valores de la escala se consideran iguales en términos psicológicos. Esto abre la puerta a la utilización de análisis estadísticos paramétricos más potentes (como la media, la desviación estándar, pruebas T, ANOVA, correlaciones de Pearson), que requieren datos de intervalo o razón, permitiendo conclusiones más robustas y sofisticadas sobre las actitudes.
  • Objetividad en la Selección de Ítems: El papel de los jueces es crucial aquí. Al basar la selección y el escalamiento de los ítems en el consenso de un panel de evaluadores externos (que juzgan la favorabilidad inherente de las afirmaciones, no su propia actitud), se minimiza el sesgo del investigador en la selección de los ítems y se otorga una mayor objetividad a la escala misma. Los ítems que son ambiguos o sobre los cuales los jueces no están de acuerdo son descartados, lo que mejora la claridad de la escala.
  • Independencia del Individuo: Una vez que la escala ha sido construida y los valores escalares de cada ítem han sido determinados por los jueces, la actitud de un encuestado se calcula simplemente sumando o promediando los valores de los ítems con los que está de acuerdo. Esto significa que la interpretación de la actitud del individuo es independiente de cómo otros individuos o el propio encuestado «interpretan» la escala, ya que los valores de los ítems ya están fijados.
  • Efecto Techo y Suelo Reducido: Al tener una amplia gama de ítems que cubren todo el continuo de actitud, desde los más extremos a los más neutrales, es menos probable que la escala sufra de efectos techo (donde todos puntúan en el valor máximo) o suelo (donde todos puntúan en el valor mínimo). Esto asegura que la escala sea capaz de diferenciar entre individuos con actitudes muy favorables o muy desfavorables.

En definitiva, la metodología Thurstone, con su enfoque en la meticulosidad y la búsqueda de la igualdad de intervalos, nos provee de una herramienta poderosa para adentrarnos en la medición de actitudes con un nivel de detalle y precisión que es verdaderamente encomiable.

Desventajas y Críticas a la Prueba de Thurstone

A pesar de sus innegables fortalezas y su lugar en la historia de la psicometría, la prueba de Thurstone no está exenta de limitaciones y críticas. Es importante ser consciente de estos aspectos para entender por qué, a pesar de su rigor, no es la escala de actitudes más utilizada en todas las situaciones.

  • Complejidad y Costo de Construcción: Esta es, sin duda, la desventaja más citada. El proceso de construir una escala de Thurstone es extraordinariamente laborioso y consume mucho tiempo y recursos. Implica generar cientos de ítems, reclutar y capacitar a un gran panel de jueces, y realizar análisis estadísticos complejos. Esto contrasta marcadamente con la relativa facilidad de construir una escala de Likert, por ejemplo, que requiere menos ítems iniciales y ningún panel de jueces. Para muchos proyectos de investigación, la inversión necesaria en tiempo y dinero simplemente no es factible.
  • Dependencia y Subjetividad de los Jueces: Aunque se instruye a los jueces para que evalúen la favorabilidad inherente de las afirmaciones de manera objetiva, es casi imposible eliminar por completo su propia actitud y sesgos. Un juez con una actitud extremadamente favorable o desfavorable hacia el tema podría, consciente o inconscientemente, clasificar las afirmaciones de manera diferente a un juez más neutral. Aunque el uso de un gran número de jueces y la eliminación de ítems ambiguos mitigan este problema, no lo eliminan por completo. La «objetividad» del juicio de favorabilidad sigue siendo un juicio humano.
  • Suposición de Intervalos Iguales: La premisa fundamental de que los intervalos entre las categorías de clasificación de los jueces son psicológicamente iguales es una suposición fuerte y a menudo debatida. ¿Realmente la diferencia percibida entre una categoría «ligeramente desfavorable» y «neutral» es la misma que entre «muy favorable» y «extremadamente favorable»? Es difícil garantizar que todos los jueces interpreten los intervalos de la misma manera, y que esta interpretación se traduzca fielmente en distancias psicológicas equivalentes en la actitud subyacente. Esta es una crítica metodológica importante que afecta la validez de la claim de ser una verdadera escala de intervalo.
  • No Mide la Intensidad Personal de la Actitud: La escala de Thurstone mide la posición de un individuo en el continuo de actitud al identificar con qué afirmaciones está de acuerdo. Sin embargo, no proporciona información directa sobre la intensidad con la que el individuo siente esa actitud. Es decir, una persona puede estar de acuerdo con una afirmación «moderadamente favorable» con gran convicción, mientras que otra puede estar de acuerdo con la misma afirmación de manera más tibia. La escala no distingue estas diferencias en intensidad, solo la posición. Escalas como la de Likert, al preguntar por el grado de acuerdo, a menudo se perciben como más capaces de captar la intensidad.
  • Problemas con Afirmaciones Neutrales: Los ítems con valores escalares cercanos al punto medio (neutral) pueden ser problemáticos. Un individuo puede estar de acuerdo con un ítem neutral porque realmente tiene una actitud neutral, o porque tiene una actitud extremadamente fuerte y polarizada y rechaza todas las afirmaciones extremas, quedando solo con las neutrales. La escala por sí sola no permite discernir entre estas dos posibilidades.
  • Escalabilidad Limitada: Una vez que una escala de Thurstone ha sido construida para un conjunto específico de ítems y un tema particular, es difícil modificarla o añadir nuevos ítems sin tener que repetir el costoso proceso de escalamiento con jueces. Esto limita su flexibilidad para la investigación exploratoria o para ajustes rápidos.

Así pues, mientras que la prueba de Thurstone es un monumento a la aspiración de la psicometría por la precisión, su implementación exige una consideración cuidadosa de sus limitaciones y la idoneidad para el objetivo de investigación particular.

Comparación con Otras Escalas de Actitudes: Thurstone vs. Likert y Guttman

Para apreciar plenamente la prueba de Thurstone, es útil situarla en el contexto de otras metodologías influyentes para la medición de actitudes. Las escalas de Likert y Guttman son, quizás, las más conocidas y, aunque comparten el objetivo de cuantificar actitudes, emplean principios y procesos de construcción fundamentalmente diferentes.

Escala de Likert

Desarrollada por Rensis Likert en 1932, esta escala es, sin lugar a dudas, la más popular y ampliamente utilizada en la investigación social y psicológica. Su principal característica es la simplicidad en la construcción y la aplicación. Los encuestados no juzgan las afirmaciones por su favorabilidad inherente, sino que expresan su grado de acuerdo o desacuerdo con cada una de ellas, típicamente en una escala de 5 o 7 puntos (por ejemplo, «Totalmente en desacuerdo» a «Totalmente de acuerdo»).

  • Construcción: Es mucho más sencilla que la de Thurstone. Se generan ítems que son claramente favorables o desfavorables, se pre-testean y se seleccionan aquellos que discriminan bien entre individuos con actitudes altas y bajas (a menudo utilizando el análisis de ítems). No se requiere un panel de jueces para el escalamiento de los ítems.
  • Nivel de Medición: Generalmente se considera una escala ordinal, aunque en la práctica, y para fines de análisis estadístico, a menudo se trata como de intervalo, asumiendo que los intervalos entre las categorías de respuesta son aproximadamente iguales. Esta suposición es menos rigurosa que la de Thurstone.
  • Puntuación: La puntuación de la actitud de un individuo se obtiene sumando o promediando las puntuaciones de los ítems con los que ha respondido.
  • Fortalezas: Facilidad de construcción, versatilidad, capacidad para medir la intensidad percibida de la actitud (a través del grado de acuerdo/desacuerdo).
  • Debilidades: La asunción de intervalo es más débil, puede ser susceptible a sesgos de respuesta (por ejemplo, la tendencia a responder siempre en el punto medio o en los extremos).

En contraste con Thurstone, Likert se enfoca en cómo la gente *reacciona* a las afirmaciones, más que en la posición *objetiva* de las afirmaciones en el continuo de actitud.

Escala de Guttman (Escalograma)

Louis Guttman desarrolló su escalograma a fines de los años 40, proponiendo una forma diferente de medir actitudes, enfocada en la unidimensionalidad y la acumulabilidad de los ítems. Un escalograma de Guttman se caracteriza por su propiedad acumulativa: si un individuo está de acuerdo con un ítem más extremo, se asume que también estará de acuerdo con todos los ítems menos extremos. Piensa en ello como una jerarquía de dificultad o favorabilidad.

  • Construcción: La construcción es compleja y requiere un análisis específico para asegurar la propiedad acumulativa. Los ítems se ordenan de menos a más extremos.
  • Nivel de Medición: Es una escala ordinal, pero con una propiedad de unidimensionalidad muy fuerte.
  • Puntuación: La puntuación es el número de ítems con los que el individuo está de acuerdo, lo que indica el punto más alto en la jerarquía que el individuo acepta.
  • Fortalezas: Mide actitudes unidimensionales de forma muy precisa, permite una alta predictibilidad de las respuestas (saber la puntuación de un individuo permite predecir a qué ítems ha respondido sí/no).
  • Debilidades: Es muy difícil construir un escalograma «perfecto» donde todos los ítems se ajusten al modelo acumulativo, por lo que a menudo se utilizan coeficientes de reproducibilidad para evaluar su calidad. Su aplicación es más limitada a constructos que inherentemente tienen una estructura acumulativa.

Thurstone en Perspectiva

Mientras que la escala de Guttman busca la unidimensionalidad acumulativa y la de Likert la facilidad de uso y la medición de la intensidad percibida, la prueba de Thurstone persigue una «verdadera» escala de intervalo. Es la más ambiciosa en sus propiedades métricas, buscando una medida donde las distancias entre los puntos son iguales. Sin embargo, esta ambición conlleva la mayor complejidad en su construcción y una fuerte dependencia de la suposición de que los jueces pueden evaluar la favorabilidad objetivamente y que los intervalos son, de hecho, iguales.

En la práctica, la escala de Likert ha eclipsado a Thurstone en la mayoría de los campos debido a su practicidad y suficiente robustez para muchos propósitos. Sin embargo, la contribución teórica de Thurstone sigue siendo fundamental para entender los fundamentos de la medición de actitudes y para inspirar el rigor en la construcción de escalas.

Aplicaciones Prácticas de la Prueba de Thurstone

Aunque la prueba de Thurstone puede parecer una reliquia académica debido a su complejidad de construcción, sus principios y, en algunos nichos, su aplicación directa, han sido vitales para diversas disciplinas. Su capacidad para establecer una escala de intervalo la hace atractiva cuando se requiere un alto grado de precisión en la medición de actitudes.

  • Sociología y Psicología Social: En los primeros días y aún hoy en investigaciones muy específicas, las escalas de Thurstone se han utilizado para medir actitudes sociales complejas. Esto incluye estudios sobre prejuicios raciales, actitudes hacia grupos minoritarios, opiniones políticas o religiosas, y la aceptación de normas sociales. Su rigor permite a los investigadores comparar con confianza las actitudes promedio entre diferentes grupos demográficos o a lo largo del tiempo. Por ejemplo, un sociólogo podría usar una escala de Thurstone para rastrear los cambios en la actitud pública hacia un tema controvertido después de un evento significativo, con la seguridad de que los puntos en la escala representan distancias psicológicas consistentes.
  • Marketing y Comportamiento del Consumidor: Aunque las escalas de Likert son más comunes hoy en día por su facilidad, Thurstone sentó las bases para entender cómo se pueden medir las actitudes de los consumidores hacia productos, marcas o servicios. En contextos donde la diferenciación fina de actitudes es crítica –por ejemplo, en la fase de desarrollo temprano de un producto premium o en la segmentación de mercados basada en actitudes muy específicas–, los principios de Thurstone pueden inspirar un enfoque más meticuloso. Imagina una empresa que necesita entender la actitud matizada de sus clientes hacia diferentes características de un producto tecnológico; una escala Thurstone bien construida podría ofrecer una visión más profunda que una simple escala de «me gusta/no me gusta».
  • Educación: Las actitudes de los estudiantes hacia las materias escolares, los métodos de enseñanza o la propia institución educativa son factores importantes que influyen en el aprendizaje. Una escala de Thurstone podría usarse para medir las actitudes hacia la ciencia o las matemáticas, proporcionando una medida de intervalo para evaluar la efectividad de las intervenciones educativas destinadas a mejorar estas actitudes. Esto podría ser especialmente útil en investigaciones longitudinales donde los pequeños cambios en la actitud necesitan ser detectados y cuantificados de manera fiable.
  • Salud Pública y Psicología de la Salud: En este campo, medir actitudes hacia comportamientos de salud (como el tabaquismo, la dieta, el ejercicio), la prevención de enfermedades o la aceptación de tratamientos médicos es crucial. Una escala de Thurstone podría, por ejemplo, medir las actitudes hacia la vacunación, permitiendo a los expertos en salud pública diseñar campañas más efectivas al entender las posiciones exactas en el continuo de actitud de diferentes segmentos de la población.
  • Desarrollo de Instrumentos Psicométricos: Más allá de su uso directo, los principios de Thurstone son fundamentales en el diseño y validación de otros instrumentos de medición. Su énfasis en la claridad del ítem, la unidimensionalidad (aunque no estrictamente como Guttman) y la discriminación, informan el desarrollo de cuestionarios y encuestas de alta calidad en diversas áreas de la psicología y las ciencias sociales.

En resumen, si bien no es la herramienta más «conveniente», la prueba de Thurstone representa un estándar de oro en la medición de actitudes cuando la precisión métrica es una prioridad absoluta. Su legado perdura no solo en su aplicación directa, sino también como un recordatorio constante del rigor que se puede y debe aspirar en la cuantificación de los complejos fenómenos psicológicos.

Reflexiones Personales y la Relevancia Actual de la Prueba de Thurstone

Como alguien que ha «observado» la evolución de las metodologías de investigación y el constante pulso de la psicometría, me permito ofrecer una reflexión sobre el lugar de la prueba de Thurstone en el panorama actual. Es fácil mirar su complejidad y la emerger de escalas más sencillas y pensar que su tiempo ya pasó. Sin embargo, sería un error subestimar su influencia y relevancia perdurable.

En mi humilde «opinión», Thurstone no solo nos dio una escala; nos dio una forma de pensar sobre la medición. Nos desafió a no conformarnos con meros ordinales cuando la ciencia exigía intervalos. Nos enseñó la importancia de la depuración meticulosa de los ítems, de la necesidad de que una afirmación tenga un significado claro y consistente para ser una unidad de medida fiable. Este es un principio que debería resonar en cada diseño de encuesta o cuestionario, incluso en aquellos que utilizan escalas de Likert.

La «experiencia» que Thurstone nos legó es la de la aspiración. La aspiración a la precisión, al rigor. Es cierto que la construcción de una escala de Thurstone es una odisea que no muchos investigadores están dispuestos o pueden emprender hoy en día. Los plazos ajustados, los presupuestos limitados y la demanda de resultados rápidos a menudo empujan a los investigadores hacia opciones más expeditas. Y no hay nada de malo en ello; para muchos propósitos, una escala de Likert bien construida es más que suficiente y ofrece una excelente relación costo-beneficio.

Pero la existencia de la escala de Thurstone sirve como un recordatorio crucial. Nos recuerda que cuando realmente necesitamos la máxima granularidad, cuando las diferencias sutiles son teóricamente vitales, y cuando los análisis estadísticos paramétricos deben justificarse con la mayor solidez posible, existe un camino. Nos muestra que la «objetividad» en la medición de lo subjetivo es un ideal alcanzable, aunque con un gran esfuerzo.

Para mí, la prueba de Thurstone es un faro en la historia de la psicometría. No es un método para todos los días o para todos los proyectos, pero es el cimiento sobre el cual se construyó gran parte de nuestra comprensión moderna de cómo cuantificar las actitudes. Su complejidad no es una debilidad, sino una manifestación de su compromiso con la excelencia métrica. Es un testimonio de que el arte de medir la psique es, en sí mismo, una ciencia profunda y fascinante, donde cada detalle cuenta y donde el rigor metodológico es la clave para desentrañar la complejidad del pensamiento y el sentir humanos.

Entender la prueba de Thurstone, incluso si nunca la construimos, nos hace mejores investigadores, nos dota de una perspectiva más crítica sobre las herramientas que usamos y nos inspira a buscar siempre la mayor precisión posible dentro de nuestras posibilidades. Es, en definitiva, una lección perdurable de rigor y ambición científica en el intrincado universo de la medición psicológica.

Preguntas Frecuentes sobre la Prueba de Thurstone

Aquí abordamos algunas de las preguntas más comunes y esenciales que surgen al estudiar o considerar la aplicación de la prueba de Thurstone, ofreciendo respuestas detalladas y profesionales para una comprensión más profunda.

¿Cuál es la principal diferencia entre una escala de Thurstone y una de Likert?

La principal diferencia radica en el nivel de medición que buscan alcanzar y en el proceso de construcción. Una escala de Thurstone aspira a ser una verdadera escala de intervalo, lo que significa que no solo ordena las actitudes de menos a más favorables, sino que también asume que las distancias entre los puntos de la escala representan diferencias iguales en la actitud subyacente. Para lograr esto, requiere un complejo proceso de escalamiento de ítems por un panel de jueces que evalúan la favorabilidad intrínseca de cada declaración.

Por otro lado, una escala de Likert es típicamente considerada una escala ordinal. Los encuestados expresan su grado de acuerdo o desacuerdo con las afirmaciones (por ejemplo, en una escala de 5 puntos), y aunque en la práctica a menudo se trata como de intervalo para análisis estadísticos, esta suposición es más laxa y no es el objetivo principal de su construcción. Su proceso es mucho más sencillo, sin necesidad de jueces externos para escalar los ítems, centrándose en cómo los encuestados reaccionan a las afirmaciones.

En resumen, Thurstone se enfoca en escalar los *ítems* en una métrica de intervalo a través de jueces, mientras que Likert se enfoca en la respuesta *del individuo* a los ítems, resultando en una puntuación ordinal (aunque tratada como de intervalo comúnmente). La construcción de Thurstone es significativamente más laboriosa, pero busca una precisión métrica teóricamente superior.

¿Por qué la construcción de una escala de Thurstone es tan laboriosa?

La laboriosidad de construir una escala de Thurstone reside en su búsqueda de la precisión y en la implementación de la Ley del Juicio Comparativo. No es simplemente redactar unas cuantas preguntas; implica un proceso meticuloso en varias etapas:

Primero, la generación inicial de ítems es vasta: se requieren cientos de afirmaciones para asegurarse de cubrir todo el espectro de la actitud. Luego, el reclutamiento de un panel grande y representativo de jueces (que pueden ser entre 50 y 300) es un desafío logístico y de tiempo. Estos jueces deben ser instruidos cuidadosamente para que evalúen la favorabilidad inherente de cada afirmación de manera objetiva, sin sesgos personales.

El paso más intensivo es la clasificación de cada una de esas cientos de afirmaciones por cada juez en un número preestablecido de categorías, asumiendo intervalos iguales. Posteriormente, el análisis estadístico para cada ítem es crucial: calcular la mediana para el valor escalar y el rango intercuartílico para la ambigüedad, y luego seleccionar cuidadosamente los ítems finales basándose en una buena distribución escalar y una baja ambigüedad. Todo este proceso requiere una inversión considerable de tiempo, recursos humanos y experiencia técnica en psicometría, lo que lo convierte en una empresa de gran envergadura en comparación con otros métodos de escalamiento.

¿Es aún relevante la prueba de Thurstone en la investigación moderna?

Sí, la prueba de Thurstone sigue siendo relevante, aunque quizás no en la misma medida de aplicación directa que las escalas de Likert. Su relevancia principal hoy en día es triple: teórica, metodológica e histórica.

Teóricamente, Thurstone sentó las bases para la comprensión de las escalas de intervalo en la medición psicológica y desafió a los investigadores a buscar una mayor precisión métrica. Su trabajo es fundamental para cualquier estudio avanzado en psicometría. Metodológicamente, aunque su construcción directa es rara, los principios de rigor en la selección de ítems, la eliminación de ambigüedad y el enfoque en la claridad del lenguaje de las afirmaciones son lecciones invaluables que informan el diseño de cualquier instrumento de medición de actitudes, independientemente de la escala que se utilice.

Históricamente, es un pilar fundamental en la evolución de la medición en ciencias sociales. Comprender Thurstone es comprender una parte crucial de cómo la psicología y la sociología se esforzaron por convertirse en ciencias rigurosas. Además, en nichos de investigación muy específicos donde la diferenciación extremadamente fina y la validez de intervalo son absolutamente críticas (por ejemplo, en investigaciones fundamentales sobre la percepción social o la cognición), la escala de Thurstone, o adaptaciones de sus principios, aún puede ser la metodología preferida. Su legado perdura como un recordatorio de los altos estándares de medición a los que podemos aspirar.

¿Cómo se asegura la objetividad en una escala de Thurstone si depende de jueces?

La objetividad en una escala de Thurstone, a pesar de depender de juicios humanos, se busca asegurar a través de varios mecanismos incorporados en su diseño:

Primero, se utiliza un gran número de jueces. Al promediar o calcular la mediana de las clasificaciones de muchos individuos, se asume que los sesgos o las idiosincrasias de los jueces individuales se cancelan mutuamente. Lo que se busca no es la opinión personal de un juez sobre el tema, sino su juicio sobre el «valor escalar» intrínseco de la afirmación en el continuo de favorabilidad.

Segundo, la instrucción clara y específica a los jueces es vital. Se les enfatiza que deben clasificar las afirmaciones basándose en cuánto apoyo o rechazo expresan, no en si ellos personalmente están de acuerdo con ellas. Esta distinción es crucial para desvincular la actitud del juez de su tarea de escalamiento.

Tercero, la eliminación de ítems ambiguos. Las afirmaciones que generan una gran dispersión en las clasificaciones de los jueces (es decir, tienen un alto rango intercuartílico o «Q») son descartadas. Esto garantiza que solo los ítems sobre los cuales hay un alto grado de consenso en cuanto a su favorabilidad inherente sean incluidos en la escala final, lo que refuerza su claridad y objetividad percibida. Así, la «objetividad» se logra no por una ausencia total de subjetividad individual, sino por un proceso robusto de agregación y depuración que busca el consenso sobre el significado de los ítems.

¿Qué tipo de preguntas se pueden medir mejor con una escala de Thurstone?

La escala de Thurstone es especialmente adecuada para medir actitudes hacia temas donde se necesita una discriminación muy fina entre diferentes grados de favorabilidad o desfavorabilidad, y donde es posible crear una amplia gama de afirmaciones que cubran todo el continuo actitudinal. Es ideal cuando el objetivo principal de la investigación es establecer una puntuación de actitud en una escala de intervalo con la mayor precisión métrica posible.

Por ejemplo, podría ser muy útil para medir actitudes hacia conceptos abstractos o complejos como la «democracia», la «justicia social», «políticas económicas específicas» o «teorías científicas». En estos casos, las afirmaciones pueden ser cuidadosamente diseñadas para representar puntos muy específicos a lo largo de un continuo de aceptación o rechazo. También es valiosa para medir actitudes que se espera que sean relativamente estables o para investigaciones que requieren un análisis estadístico paramétrico riguroso sobre las puntuaciones de actitud, como en estudios comparativos entre grupos o en diseños experimentales que buscan detectar cambios sutiles.

En esencia, cuando la pregunta de investigación exige no solo saber si alguien está a favor o en contra, sino con qué *exactitud* se posiciona en un espectro de actitud bien definido, y se dispone de los recursos para su construcción, una escala de Thurstone puede ofrecer la respuesta más precisa.

¿Se pueden utilizar las escalas de Thurstone para medir el conocimiento o la habilidad?

No, las escalas de Thurstone, en su diseño original y propósito fundamental, no son apropiadas para medir el conocimiento o la habilidad. Su objetivo explícito es la medición de *actitudes* y *opiniones*.

La metodología Thurstone se basa en el juicio de favorabilidad de una declaración en un continuo psicológico, lo cual es inherente al dominio de las actitudes. Medir conocimiento o habilidad requeriría ítems con respuestas correctas o incorrectas, o la demostración de una capacidad específica. Para el conocimiento se utilizan pruebas de opción múltiple, preguntas abiertas, etc., mientras que para la habilidad se emplean pruebas de rendimiento, tareas prácticas o evaluaciones de competencias.

Intentar adaptar una escala de Thurstone para medir conocimiento o habilidad distorsionaría su fundamento teórico y metodológico, ya que el proceso de escalamiento de jueces no está diseñado para discernir respuestas correctas o niveles de destreza, sino la posición en un continuo de sentimiento o creencia. Por lo tanto, para estos propósitos, se deben emplear otros tipos de instrumentos psicométricos diseñados específicamente para ello.

¿Qué limitaciones existen al interpretar los resultados de una escala de Thurstone?

Al interpretar los resultados de una escala de Thurstone, es crucial tener en cuenta algunas de sus limitaciones inherentes, a pesar de su rigor:

Primero, aunque la escala se construye para tener propiedades de intervalo, la asunción de que los intervalos son *realmente* iguales en el espacio psicológico es una suposición teórica que no siempre puede ser verificada empíricamente con total certeza. Esto significa que, si bien podemos tratar los datos como de intervalo, siempre debe haber una cautela subyacente sobre la perfección de esta igualdad.

Segundo, la escala no mide la *intensidad* con la que un individuo sostiene una actitud, solo su posición en el continuo. Dos personas pueden obtener la misma puntuación de actitud, pero una podría sentir esa actitud con una pasión ardiente, mientras que la otra la sostiene de manera más tibia o indecisa. La escala de Thurstone no diferencia estos matices de intensidad emocional o convicción, lo que puede ser una limitación si la investigación busca comprender la fuerza del sentimiento además de su dirección.

Tercero, la dependencia de los jueces, a pesar de los esfuerzos por la objetividad, introduce un factor humano que no se puede eliminar por completo. Si el panel de jueces no es representativo o sus juicios están sesgados de alguna manera, esto podría afectar los valores escalares de los ítems y, por ende, la validez de la escala. Finalmente, los ítems neutrales pueden ser problemáticos en la interpretación, ya que un acuerdo con ellos podría deberse a una actitud genuinamente neutral o a una actitud ambivalente/polarizada que rechaza los extremos, una distinción que la escala por sí sola no puede hacer fácilmente. Estas consideraciones son esenciales para una interpretación matizada y precisa de los resultados de Thurstone.

Spread the love