scieee AI-readable full text Open interactive document viewer

Piloto de muestras sintéticas para proyecciones de opinión pública en Chile (mayo 2025)

Empiria Lab

Abstract

Este proyecto piloto tiene como objetivo desarrollar y validar un enfoque innovador basado en datos sintéticos para estimar proyecciones de opinión pública en Chile. Las muestras sintéticas son conjuntos de datos generados con inteligencia artificial y Large Language Models (LLMs) que replican las características clave de una población real.

Full text

INFORME 1 Piloto de muestras sintéticas para proyecciones de opinión pública en Chile Este proyecto piloto tiene como objetivo desarrollar y validar un enfoque innovador basado en datos sintéticos para estimar proyecciones de opinión pública en Chile. Las muestras sintéticas son conjuntos de datos generados con inteligencia artificial y Large Language Models (LLMs) que replican las características clave de una población real. Este informe es el resultado de un estudio encargado por Pular Consulting a Empiria Lab. Las opiniones, interpretaciones y conclusiones expresadas en este documento son las del equipo de Empira Lab y no deben atribuirse a Pular Consulting Mayo 2025 Introducción Desafíos de las encuestas tradicionales Recursos financieros Las encuestas tradicionales requieren inversiones significativas para su diseño, implementación y análisis. Recursos humanos Se necesita personal capacitado para diseñar cuestionarios, realizar entrevistas y procesar datos. Tasas de respuesta Problemas como la fatiga de entrevistas y dificultades para alcanzar grupos específicos pueden resultar en muestras sesgadas. Tiempo requerido El proceso completo desde el diseño hasta el análisis demanda plazos extensos que pueden afectar la actualidad de los resultados. Mayo 2025 3 Potencial de los LLMs Simulación realista Capacidad para emular interacciones humanas complejas Captura de dinámicas de opinión Representación de actitudes sociales matizadas Generación de datos sintéticos Creación de conjuntos de datos que replican propiedades estadísticas Mayo 2025 4 Metodología Metodología del piloto Encuesta para benchmark Encuesta probabilística CEP de agosto-septiembre 2024. Error muestral de +/- 2,8 con intervalo de confianza del 95% y tasa de respuesta del 61,3%. Esta encuesta incluyó 1.482 entrevistas presenciales realizadas en 127 municipios chilenos. LLMs para prueba de concepto Prueba de diversos modelos de última generación, incluyendo GPT-4o (2024-11-20), GPT-4o-mini (2024-07-18), GPT-4.5-preview (2025-02-27), Llama 4 Maverick (400B), Llama 3.3 (70B), Qwen 2.5 (32B), Gemma 2.5 (12B), entre otros. Esta prueba de concepto implicó la creación de 38.532 perfiles sintéticos. Estrategias de prompting Dos enfoques: uno utilizando exclusivamente información demográfica y otro incorporando dimensiones actitudinales junto con características demográficas. LLMs para benchmark definitivo GPT-4o-mini*, GPT-4o*, Llama 4 Maverick (400B)* y Qwen 2.5 (32B). El benchmark final implicó la creación de 189.696 perfiles sintéticos. * Mejor rendimiento predictivo en comparación con los datos de la encuesta probabilística Mayo 2025 6 Muestras sintéticas finales Para los módulos de preguntas generales y experimentales utilizamos GPT-4o-mini*, el modelo con mejor rendimiento en las pruebas de benchmark. Para el módulo de intención de voto utilizamos el siguiente procedimiento: 1 2 3 * GPT-4o-mini y la combinación con Maverick ofrecen el mejor balance entre rendimiento, costo y tiempo de cómputo Mayo 2025 7 Intención de voto Combinamos resultados de GPT4o-mini y Llama 4 Maverick (400B)* Método de pooling Agrupamos ambos conjuntos de datos mediante ponderación de la muestra probabilística base Normalización Calculamos la participación de cada opción electoral según el peso total Muestras mayo 2025 54* Preguntas Cobertura para módulos sobre percepción país, evaluación gobierno, confianza en instituciones, intención de voto y experimental 84.474** Perfiles sintéticos Con base en 1.482 perfiles sociodemográficos y actitudinales de la muestra nacional probabilística base 27,3** Horas de cómputo El modelo usado para los perfiles finales fue GPT-4o-mini y para intención de voto se combinó con Llama 4 Maverick (400B) * Este cuestionario se elaboró tomando como referencia preguntas del CEP, Latinobarómetro, PUC y otras encuestas reconocidas ** Se elevan a 312.702 perfiles y 81,2 horas al incluir el benchmark Mayo 2025 8 Resultados Módulo Percepción País Mayo 2025 16 Resultados Módulo Evaluación Gobierno Mayo 2025 18 Mayo 2025 19 Mayo 2025 20 Mayo 2025 21 Mayo 2025 22 Mayo 2025 23 Mayo 2025 24 Resultados Módulo Confianza en Instituciones Resultados Módulo Experimental Mayo 2025 33 Mayo 2025 34 Limitaciones y posibilidades futuras Limitaciones Rendimiento moderado Las métricas utilizadas para evaluar la similitud entre muestras sintéticas generadas por LLMs y respuestas humanas reales muestran que los modelos alcanzan un nivel aceptable de precisión. Los valores oscilan entre 0.6 y 0.9 según la pregunta y el indicador específico*. Simplificación de la complejidad Aunque las respuestas sintéticas logran capturar patrones y tendencias generales, no reproducen con fidelidad la complejidad multidimensional de la opinión pública real. Un ejemplo es la pregunta sobre percepción de aumento en la delincuencia, no incluida en esta presentación, donde el modelo predijo que un 99% de los encuestados consideraba que había aumentado. * Más detalles estarán disponibles en el reporte técnico: González-Bustamante, B., Verelst, N., & Cisternas, C. (2025, forthcoming ). Emulating Public Opinion: A Proof-of-Concept of AI-Generated Synthetic Survey Responses for the Chilean Case. Empiria Lab Method Series , 1. Mayo 2025 36 Posibilidades futuras Considerando los resultados obtenidos, las futuras líneas de investigación podrían involucrar diferentes niveles de esfuerzo y recursos. * El fine-tuning y la alineación de modelos son las vías más prometedoras, sin embargo, requieren más tiempo y recursos Mayo 2025 37 Ajuste de estrategia de prompting Esfuerzo medio-bajo. Refinar las instrucciones para los modelos Posprocesamiento Esfuerzo medio. Reponderación o calibración de muestras sintéticas Prueba de modelos adicionales Esfuerzo medio. Evaluar modelos de razonamiento específicos o nuevos LLMs Fine-tuning y alineación Esfuerzo alto. Ajuste preciso de modelos para mejorar rendimiento* www.empirialab.cl [email protected]