Muestras sintéticas para proyecciones de opinión pública en Chile (septiembre 2025)
Abstract
Esta presentación utiliza un enfoque innovador basado en datos sintéticos para estimar proyecciones de opinión pública en Chile. Las muestras sintéticas son conjuntos de datos generados con inteligencia artificial y Large Language Models (LLMs) que replican las características clave de una población real.
Full text
e INFORME 2 Muestras sintéticas para proyecciones de opinión pública en Chile Esta presentación utiliza un enfoque innovador basado en datos sintéticos para estimar proyecciones de opinión pública en Chile. Las muestras sintéticas son conjuntos de datos generados con inteligencia artificial y Large Language Models (LLMs) que replican las características clave de una población real. Este informe es el resultado de un estudio encargado por Pular Consulting a Empiria Lab. Las opiniones, interpretaciones y conclusiones expresadas en este documento son las del equipo de Empira Lab y no deben atribuirse a Pular Consulting Septiembre 2025
Introducción
Desafíos de las encuestas tradicionales Recursos financieros Las encuestas tradicionales requieren inversiones significativas para su diseño, implementación y análisis. Recursos humanos Se necesita personal capacitado para diseñar cuestionarios, realizar entrevistas y procesar datos. Tasas de respuesta Problemas como la fatiga de entrevistas y dificultades para alcanzar grupos específicos pueden resultar en muestras sesgadas. Tiempo requerido El proceso completo desde el diseño hasta el análisis demanda plazos extensos que pueden afectar la actualidad de los resultados. Septiembre 2025 3
Potencial de los LLMs Simulación realista Capacidad para emular interacciones humanas complejas Captura de dinámicas de opinión Representación de actitudes sociales matizadas Generación de datos sintéticos Creación de conjuntos de datos que replican propiedades estadísticas Septiembre 2025 4
Metodología
Metodología del piloto Encuesta para benchmark Encuesta probabilística CEP de agosto-septiembre 2024. Error muestral de +/- 2,8 con intervalo de confianza del 95% y tasa de respuesta del 61,3%. Esta encuesta incluyó 1.482 entrevistas presenciales realizadas en 127 municipios chilenos. LLMs para prueba de concepto (mayo 2025) Prueba de diversos modelos de última generación, incluyendo GPT-4o (2024-11-20), GPT-4o-mini (2024-07-18), GPT-4.5-preview (2025-02-27), Llama 4 Maverick (400B), Llama 3.3 (70B), Qwen 2.5 (32B) y Gemma 2.5 (12B), entre otros. Esta prueba de concepto implicó la creación de 38.532 perfiles sintéticos. Estrategias de prompting Dos enfoques: uno utilizando exclusivamente información demográfica y otro incorporando dimensiones actitudinales junto con características demográficas. LLMs para benchmark definitivo (mayo 2025) GPT-4o-mini*, GPT-4o*, Llama 4 Maverick (400B)* y Qwen 2.5 (32B). El benchmark final implicó la creación de 189.696 perfiles sintéticos. * Mejor rendimiento predictivo en comparación con los datos de la encuesta probabilística Septiembre 2025 6
Muestras sintéticas finales Para los módulos de preguntas generales y experimentales utilizamos GPT-4o-mini*, el modelo con mejor rendimiento en las pruebas de benchmark. Para el módulo de intención de voto utilizamos el siguiente procedimiento: 1 2 3 * GPT-4o-mini y la combinación con Maverick ofrecen el mejor balance entre rendimiento, costo y tiempo de cómputo Septiembre 2025 7 Intención de voto Combinamos resultados de GPT4o-mini y Llama 4 Maverick (400B)* e información contextual Método de pooling Agrupamos ambos conjuntos de datos mediante ponderación de la muestra probabilística base Normalización Calculamos la participación de cada opción electoral según el peso total
Muestras septiembre 2025 Los LLMs se ejecutaron entre el 6 y el 8 de septiembre de 2025. Dado que las muestras sintéticas son respuestas simuladas, en este estado de desarrollo, no es posible estimar un margen de error similar al que utilizan las encuestas tradicionales. 53* Preguntas Cobertura para módulos sobre percepción país, evaluación gobierno, confianza en instituciones, intención de voto y experimental 84.474** Perfiles sintéticos Con base en 1.482 perfiles sociodemográficos y actitudinales de la muestra nacional probabilística base 26,9** Horas de cómputo El modelo usado para los perfiles finales fue GPT-4o-mini y para intención de voto se combinó con Llama 4 Maverick (400B) * Este cuestionario se elaboró tomando como referencia preguntas del CEP, Latinobarómetro, PUC y otras encuestas reconocidas ** Se elevan a 397.176 perfiles y 108,1 horas al incluir el benchmark y la muestra de mayo 2025 Septiembre 2025 8
Resultados Módulo Percepción País
Septiembre 2025 16
Septiembre 2025 17
Resultados Módulo Evaluación Gobierno
Septiembre 2025 19
Septiembre 2025 20
Septiembre 2025 21
Septiembre 2025 22
Resultados Módulo Confianza en Instituciones
Septiembre 2025 24
Septiembre 2025 25
Septiembre 2025 31
Septiembre 2025 32
Limitaciones y posibilidades futuras
Limitaciones Rendimiento moderado Las métricas utilizadas para evaluar la similitud entre muestras sintéticas generadas por LLMs y respuestas humanas reales muestran que los modelos alcanzan un nivel aceptable de precisión. Los valores oscilan entre 0.6 y 0.9 según la pregunta y el indicador específico*. Simplificación de la complejidad Aunque las respuestas sintéticas logran capturar patrones y tendencias generales, no reproducen con fidelidad la complejidad multidimensional de la opinión pública real. Un ejemplo es la pregunta sobre percepción de aumento en la delincuencia, no incluida en esta presentación, donde el modelo predijo que un 99% de los encuestados consideraba que había aumentado. * Más detalles están disponibles en el reporte técnico: González-Bustamante, B., Verelst, N., & Cisternas, C. (2025). Emulating Public Opinion: A Proof-ofConcept of AI-Generated Synthetic Survey Responses for the Chilean Case. Empiria Lab Method Series , 1. https://doi.org/10.5281/zenodo.17077752 Septiembre 2025 35
Posibilidades futuras Considerando los resultados obtenidos, las futuras líneas de investigación podrían involucrar diferentes niveles de esfuerzo y recursos. * El fine-tuning y la alineación de modelos son las vías más prometedoras, sin embargo, requieren más tiempo y recursos Septiembre 2025 36 Ajuste de estrategia de prompting Esfuerzo medio-bajo. Refinar las instrucciones para los modelos Posprocesamiento Esfuerzo medio. Reponderación o calibración de muestras sintéticas. Es recomendable actualizar la encuesta de referencia Prueba de modelos adicionales Esfuerzo medio. Evaluar modelos de razonamiento específicos o nuevos LLMs, especialmente GPT-5 y similares Fine-tuning y alineación Esfuerzo alto. Ajuste preciso de modelos para mejorar rendimiento*
www.empirialab.cl [email protected]