Capítulo 05 de 5
Método y límites
Esta página resume cómo se hizo el trabajo y qué no puede decir. La investigación empezó como tesis de licenciatura en Sociología (UNMdP) y se amplió después con el corpus de Twitter y el cruce entre plataformas.
El corpus
- Notas: 62 artículos de 0223.com.ar sobre el conflicto (marzo–diciembre de 2023), recolectados con un navegador automatizado.
- Comentarios de Facebook: 522 comentarios de lectores publicados a través del complemento de comentarios de Facebook en esas notas, con su estructura de respuestas reconstruida. Mientras la investigación estaba en curso, el diario retiró el complemento de comentarios: los originales ya no están en línea. Es un ejemplo de lo frágil que es la evidencia digital.
- Tweets: de 7.717 tweets que mencionaban “Marquesado” entre 2017 y 2024, 2.307 hablan efectivamente del conflicto. La selección combinó etiquetado manual, un modelo de lenguaje y reglas de palabras clave; los casos dudosos se revisaron uno por uno.
Las herramientas
- Frecuencias, pares de palabras y vocabulario distintivo: minería de texto clásica, con una lista de palabras vacías en español.
- Sentimiento, emoción y discurso de odio: pysentimiento (modelos BERT en español). Es un modelo estadístico: acierta en la mayoría de los casos y se equivoca en la ironía, en los sobreentendidos locales y en los textos muy cortos.
- Postura y género en Facebook: etiquetado manual. En Twitter: manual para una muestra y automático (Gemini) para el resto; donde no coincidían, se revisó a mano.
- Todo el circuito —importar, etiquetar, analizar y publicar— se hizo en HLab, la plataforma del laboratorio, con los datos anonimizados.
Lo que estos datos no dicen
- Los comentarios y los tweets no representan a “la sociedad”: representan a quienes eligieron escribir en público, que son pocos y muy activos.
- Un modelo de sentimiento no lee intenciones. “Negativo” quiere decir que el texto suena negativo, no que la persona esté en contra de algo en particular.
- El género se infirió a partir de nombres y perfiles; es una aproximación, no una identidad declarada.
- Los conteos cambian cuando se corrige una etiqueta o se agrega una fuente: esta página se regenera a partir del corpus, y los números pueden diferir levemente de los publicados en la tesis.