El INE participa en el XLII Congreso Nacional de Estadística, Investigación Operativa y Ciencia de Datos

Presenta la ponencia "ES_DataLab: Laboratorio de datos para contribuir al desarrollo de la investigación".
El laboratorio de datos facilita proyectos de alto valor científico
El laboratorio de datos facilita proyectos de alto valor científico

Varios expertos del INE participaron a primeros del mes de septiembre en el XLII Congreso Nacional de Estadística, Investigación Operativa y Ciencia de Datos (SEIO 2026) celebrado en Santiago de Compostela.

Rocío Fuente, subdirectora general del Laboratorio de datos en el INE, presentó la ponencia "ES_DataLab: Laboratorio de datos para contribuir al desarrollo de la investigación", en la que se expusieron los principales objetivos, avances y retos de esta iniciativa.

ES_DataLab constituye la infraestructura de acceso seguro a datos para investigación impulsada por el INE con la colaboración de otros organismos públicos como la Secretaría de Estado de la Seguridad Social y Pensiones, el Banco de España, la Agencia Estatal de la Administración Tributaria o el Servicio Público de Empleo Estatal.

Su objetivo es facilitar que la comunidad investigadora pueda desarrollar proyectos de alto valor científico utilizando información detallada procedente de distintas fuentes estadísticas y administrativas, siempre bajo estrictas garantías de confidencialidad y protección de los datos.

La presentación puso de relieve el papel del INE como coordinador entre los organismos e instituciones que suministran información para fines de investigación, favoreciendo un modelo de colaboración que amplía las oportunidades de acceso a datos y potencia la generación de conocimiento basado en evidencias.

Fuente destacó el potencial crecimiento del catálogo de datos de ES_DataLab, lo que permitirá abordar investigaciones cada vez más relevantes para el análisis económico y social.

Imputación masiva

Miguel Ángel Martínez Vidal, Subdirector General de Formación, Análisis e Innovación en la Producción Estadística del INE fue uno de los moderadores de esta sesión, en la que también participaron Pedro García, Adrián Pérez y Javier de las Heras.

Javier de las Heras, director de programa de la Subdirección General de Estadísticas de Sectores Económicos del INE, presentó el trabajo desarrollado en su subdirección sobre la aplicación de técnicas de imputación masiva en las estadísticas estructurales de empresas.

Destacó las posibilidades que ofrece el uso de registros administrativos para reducir la dependencia de la información muestral, la valoración positiva de los primeros resultados y posibles soluciones para variables que no pueden obtenerse directamente de datos administrativos.

Muestreo y codificación

Pedro García Segador, consejero técnico de la Subdirección General de Metodología y Diseño de Muestras, expuso la presentación “Admisibilidad en muestreo con grafos de incidencia bipartitos”, en la que abordó el muestreo en poblaciones finitas modeladas como grafos, destacando cómo la incorporación de relaciones entre unidades resulta clave en metodologías no convencionales como el muestreo indirecto, en red o adaptativo.

Explicó cómo este marco permite tratar escenarios complejos con múltiples vías de observación y demostró formalmente la existencia de diversos estimadores admisibles alternativos al clásico estimador de Horvitz-Thompson.

Por su parte, Adrián Pérez Bote, jefe de área de la misma subdirección, realizó una presentación sobre marco metodológico para la construcción de codificadores de texto libre conforme a clasificaciones estadísticas oficiales.

En ella, hizo distintas aproximaciones convencionales a la codificación de textos según clasificaciones estadísticas, e introdujo métodos innovadores que vienen a complementar y adaptar las estrategias anteriores para adaptarlas a las necesidades de los institutos de estadística. También mostró la herramienta CodIA, y explicó qué metodología se había utilizado para su desarrollo.

Prioridades de modernización

Por otro lado, María Novás, subdirectora general de Metodología y Diseño de Muestras del INE, moderó la sesión “Propuestas desde la ciencia y la ingeniería de datos para problemas específicos en Estadística Pública”, dedicada a presentar los resultados de varias de las líneas de investigación que el INE impulsó a través de la convocatoria de subvenciones para proyectos de investigación científica publicada en 2021.

La sesión abordó temas que respondían directamente a algunas de las prioridades identificadas por el INE para modernizar la producción estadística. Entre ellas la codificación automática mediante machine learning, la integración de datos de pagos con tarjeta para mejorar la estimación del gasto turístico o el uso de técnicas de aprendizaje automático para la imputación de datos y obtener un indicador adelantado del índice de cifra de negocios en la Industria.