Hace unos días asistimos a una charla de Mari Luz Congosto dentro del primer seminario «Big Data, Social Media & Society» organizada por el Grupo de Investigación Estudios Sociales e Intervención Social de la Universidad de Huelva. Fue una charla interesantísima en la que se trató el uso de las redes sociales en general y Twitter en particular, y como extraer los datos que este servicio nos cede gratuitamente (APIs Rest y Streaming) y su representación gráfica a través de las librerías D3.js.
A raíz del foro abierto, nos fuimos pensado en que la ocasión bien merecía una entrada en el blog pero desde el punto de vista desde el que trabajamos, R, apoyados en la librería TwitteR.
¿Que es TwitteR?
TwitteR es un paquete del entorno de R que nos permite extraer los datos que nos cede Twitter a través de sus APIs. Este paquete tiene enormes posibilidades ya que podremos extraer los tweets de los usuarios que queramos, ver sus seguidores y a quien sigue, favoritos, así como timelines y tendencias, ademas de extraer los tweets relacionados con una temática e incluso georreferenciarlos en un radio de acción definido.
Una de las muchas utilidades de este paquete es el extraer la información y volcarla a una base de datos. De esta forma no tenemos que estar constantemente «preguntando» a Twitter por fechas pasadas, ya que comienza a partir del último valor almacenado optimizando así la recolección de los datos.
Desde un punto de vista práctico, nos vamos a tomar la licencia de decir que es uno de los paquetes de R más sencillos de utilizar, ya que su sintaxis es muy intuitiva incluso para los neofitos en este software estadístico.
¿En que nos puede ser útil TwitteR?
TwitteR puede sernos útil en muchos aspectos relacionados con Social Media y el Big Data en general. En concreto, lo hemos utilizado de las siguientes formas:
- Data text mining (Minería de textos). A través de extraer los tweets de uno o varios usuarios, se pueden detectar tendencias y ver en que convergen o divergen de otros usuarios al realizar la comparación entre ellos. Como ejemplo valga la siguiente nube de palabras en la que comparamos los últimos 2.000 tweets de los representantes de los principales grupos políticos de España: Mariano Rajoy (en verde), Pedro Sánchez (en marrón), Albert Rivera (en rojo) y Pablo Iglesias (en azul). Previamente, se debe realizar una concienzuda limpieza de palabras y símbolos sobrantes, proceso que se puede automatizar mediante la librería de Data Text Mining tm.

¿Cual es la palabra que más han utilizado todos y quien es el que más lo ha hecho? Las posibilidades son infinitas dentro de este campo del Data Mining. - Geolocalización de tweets y mapas de calor. Como se ha dicho anteriormente, la librería TwitteR permite extraer los tweets relacionados con una determinada palabra, incluso filtrando por un rango temporal. En ocasiones, estos tweets estan geoposicionados, por lo que se pueden crear fácilmente mapas de situación y de intensidad sobre un determinado tema (dejaremos para otra ocasión como podremos manejarlos con Sistemas de Información Geográfica). A continuación se pueden ver el primer caso para la palabra «Huelva»:

- Evolución y tendencias de palabras. Dado que la librería permite extraer tweets entre momentos temporales (además de guardarlos directamente en nuestra base de datos), es muy fácil consultar las tendencias de uso de varias palabras.

Si queréis ahondar sobre el tema de la extracción de datos de Twitter y representación gráfica, fuera del entorno R, os recomendamos que le echéis un vistazo al trabajo tan interesante que realiza Mari Luz Congosto y que publica frecuentemente en su blog
Trackbacks/Pingbacks