Derribando las listas principales: Evaluación de la precisión de las listas de sitios web populares
Contribuciones
Kimberly Ruth, Deepak Kumar, Brandon Wang, Luke Valenta, Zakir Durumeric
Detalles
IMC '22: Proceedings of the 22nd ACM Internet Measurement Conference, Pages 374–387, October 25-27, France. 2022.
Resumen
Los investigadores confían en listas de sitios web populares como el Top Million de Alexa para medir el estado de la web y evaluar protocolos y sistemas propuestos. Trabajos previos han cuestionado la corrección y la consistencia de estas listas, pero sin una "verdad fundamental" con la que comparar, no ha habido una evaluación directa de las listas. En este artículo de investigación, nos esforzamos por evaluar la precisión relativa de siete listas principales de sitios web. Derivamos un conjunto de métricas de popularidad a partir de solicitudes del lado del servidor vistas en una importante CDN que presta servicios de forma autorizada a una parte significativa de los sitios web más populares. Evaluamos las listas principales en función de estas métricas y mostramos que la mayoría captura la popularidad de la web de forma deficiente, con la excepción del conjunto de datos del Informe de experiencia del usuario de Chrome, que se evalúa en línea con las diferencias entre las diferentes métricas de popularidad calculadas a partir de la misma fuente de datos de la CDN. Exploramos los sesgos que reducen la precisión de otras listas y, finalmente, desarrollamos recomendaciones para los investigadores que estudian la web en el futuro.