I – Magia estadística
Problema: Teníamos un mapa de carreteras, pero algún desaprensivo nos lo robó. Sólo dejó la primera página con la tabla de distancias entre las principales ciudades. ¿Hay alguna manera de reconstruir el mapa?
Solución: Es evidente que el mapa determina las distancias, pero ¿determinan las distancias el mapa? Parece claro que no. La tabla contiene mucha menos información que el mapa; en particular, no contiene información espacial, no es más que una lista de números.
Y sin embargo, la tabla conserva la información espacial, pero, por así decirlo, en forma latente. Hay una técnica estadística que es capaz de revelar la figura oculta en la lista de números. Se llama escalado multidimensional. Hay que decirle al algoritmo en cuantas dimensiones van a estar nuestros puntos (para el mapa de carreteras, dos) y los coloca de modo que sus distancias mutuas reproduzcan, en la medida de lo posible, las que le hemos dado en forma de tabla.
Me he tomado el trabajo de copiar a un archivo las distancias en km por carretera entre las capitales de provincia españolas. Hay 50 capitales no insulares, así que son 1225 datos (¡todo sea por la estadística recreativa!). Pero el resultado merece la pena. Dejamos trabajar al algoritmo et voila!:
¿Es o no magia? (El círculo grande es una simple referencia de distancias, está centrado en el centro de masas de los puntos, es decir, el centro geográfico de España). Por desgracia, el programa gratuito con el que hice los cálculos en su día ya no se encuentra en la web 
Por el mismo precio, además, podemos identificar grupos naturales de datos (“clusters”). Por ejemplo, si representamos las cien distancias más cortas (el 9% del total de distancias) por un enlace, tenemos este mapa:

…donde se aprecia el aislamiento geográfico de regiones como Galicia, Asturias o Andalucía (¡hasta hemos dado con Despeñaperros!) . Son regiones geográficas naturales, a diferencia de, por ejemplo, Aragón o Castilla-La Mancha.
II – El mapa de proximidades genealógicas
Pero el mayor atractivo de esta técnica es que permite hacer mapas de proximidades abstractas. Basta tener algún tipo de “distancia” entre los datos para construir un mapa con ellos. Los chicos del marketing, que prostituyen todo lo que tocan, lo usan para visualizar las afinidades y diferencias en la percepción de los productos por los clientes. Pero ¿por qué no usar esto para visualizar los apellidos?
Quizá pudiéramos, a partir de los datos del INE que hemos usado en los dos posts anteriores, definir una “distancia genealógica” entre provincias. Y quizá, a partir de esa tabla de distancias, podríamos reconstruir el mapa como acabamos de hacer. Sólo que el mapa que reconstruyamos sería un mapa de proximidades más interesantes que las geográficas: nos indicaría las afinidades históricas y “familiares” entre las distintas provincias.
La idea, y el procedimiento para calcular las “distancias genealógicas”, la expliqué con detalle en un post en el que me preguntaba si ese mapa se parecería más a un Mondrian (como los mapas políticos) o a un Turner (como los mapas físicos…). Y el resultado fue este mapa de proximidades genealógicas:
¡Magia de nuevo! ¿Qué podemos concluir de aquí? Para mi gusto, hay una interesantísima mezcla de orden y sorpresa. Orden básicamente geográfico, pero con sorpresas como la posición de Barcelona (explicable seguramente por la alta inmigración) y las más sorprendentes aún de Vizcaya o Segovia. ¿Estamos viendo huellas de antiguas migraciones quizá? (Acepto opiniones).
¿Hay regiones naturales aquí? Si la encontramos, habríamos mostrado (de forma objetiva, no mitológica) que hay comunidades culturales naturales, igual que Galicia o Andalucía eran, objetivamente, regiones geográficas naturales… Igual que antes, dibujamos el 9% de enlaces más cortos (pueden no parecer los más cortos sobre el mapa debido a que este tiene errores inevitables para acomodar en dos dimensiones todos los datos):
Finalmente, ¿el mapa es un Turner o un Mondrian? Ni una cosa ni otra. La maraña central es, desde luego, como un Turner (habría que decir como un Pollock, pero mantendré la terminología). Pero este núcleo no llega a las provincias de la periferia (periferia genealógica, pero que es en buena medida periferia geográfica).
En el post en el que publiqué esto por primera vez sacaba alguna conclusión, pero prefiero que ustedes saquen las suyas. Sólo quería decir algo que, por otra parte, debería ser ya evidente: si podemos hacer esta minería de datos en un par de tardes con un programa gratuito y sabiendo muy poquito de estadística, imaginen lo que pueden hacer Google o Facebook, con los mejores profesionales, la mayor potencia de cálculo, y todos los datos del mundo a su disposición.
[Fuente: pseudopodo.wordpress.com]

Sem comentários:
Enviar um comentário