IBERO crea algoritmo para detectar discurso de odio en México

IBERO algoritmo discurso de odio
Facebook
Twitter
WhatsApp
Email

El idioma español es abundante en vocablos y frases con múltiples sentidos. Una misma palabra puede tener significados radicalmente distintos dependiendo del contexto, la intención y la estructura del mensaje, pasando de un uso neutro cotidiano a expresiones que pudieran contener algún tipo de violencia. ¿Puede una máquina entender esa diferencia?

Un equipo multidisciplinario de la Universidad Iberoamericana, encabezado por el académico e investigador Mauricio Flores Gerónimo, académico-investigador del Departamento de Estudios en Ingeniería para la Innovación, desarrolló un proceso algorítmico especializado en español mexicano que procesa grandes cantidades de texto para convertir las conversaciones digitales en información útil para estudiar fenómenos sociales, opinión pública y toma de decisiones.

La herramienta utiliza técnicas de “escucha social” para analizar contenidos publicados en internet y puede contribuir a identificar fenómenos que van desde problemas cotidianos como encharcamientos y tráfico vehicular, hasta asuntos de mayor complejidad como economía, desinformación, violencia digital y discursos de odio.

La diferencia está en entender cómo hablamos los mexicanos

El proyecto surgió de una premisa que suele pasar inadvertida en el desarrollo de herramientas de inteligencia artificial: el español no se habla igual en todos los lugares y las palabras no significan lo mismo fuera de contexto. Por ello, el equipo incorporó a dos especialistas en lingüística, un politólogo y un ingeniero experto en ciencia de datos e inteligencia artificial, quienes trabajaron en las estructuras gramaticales y semánticas propias del español mexicano.

A diferencia de herramientas comerciales concebidas principalmente para el idioma inglés, este modelo busca comprender las particularidades de las expresiones utilizadas en México y evitar clasificaciones automáticas equivocadas derivadas de traducciones, modismos o usos locales.

Para ponerlo a prueba, el equipo tomó como caso de estudio las elecciones de 2024 en México, un escenario particularmente intenso por el volumen de conversaciones digitales y la presencia de agresiones verbales, ataques coordinados, descalificaciones, discriminación, lenguaje ofensivo, discurso de odio y manifestaciones colectivas de enojo, frustración, esperanza, molestia o alegría. La muestra incluyó 30,000 publicaciones de X (antes Twitter) y 10,000 de YouTube.

De 40 mil publicaciones a un mapa de emociones y agresiones

El algoritmo fue programado en Java y entrenado para clasificar textos relacionados con dos candidatas identificadas en el estudio como candidata A y candidata B. Para ello se construyeron bolsas de palabras y estructuras gramaticales que permitieron analizar tendencias y asociaciones. El método combinó dos estrategias:

N-gramas: conjuntos de palabras de orden N; en este caso, N=3 o trigramas, utilizados para cuantificar datos e identificar patrones sobre las opiniones expresadas acerca de cada candidata.

Nubes de palabras: representación gráfica de los términos asociados con mayor frecuencia a cada grupo.

El análisis permitió detectar diferencias significativas en la manera en que se hablaba de ambas figuras. En el caso de la candidata A, aparecieron contenidos relacionados con violencia de género y referencias despectivas hacia su aspecto físico. Para la candidata B, destacó la utilización de sus títulos académicos.

La combinación de ambas estrategias permitió inferir el dominio de la desinformación y actitudes de violencia durante el proceso electoral estudiado, además de identificar expresiones vinculadas con discurso de odio, violencia digital, capital cultural y emociones colectivas.

Una herramienta para advertir, no para censurar

La herramienta tiene el potencial de servir como base para desarrollar sistemas capaces de estimar automáticamente la presencia de discurso de odio en un texto y alertar al usuario antes de hacerlo público. En escuelas y universidades, también podría convertirse en un instrumento de alfabetización digital para que estudiantes reconozcan los riesgos de determinadas expresiones y reflexionen sobre sus propias decisiones.

La investigación ya trascendió el ámbito universitario. El algoritmo fue registrado ante el Instituto Nacional del Derecho de Autor (INDAUTOR) y se encuentra disponible para que otros investigadores, estudiantes y público en general puedan buscarlo, descargarlo y utilizarlo.

La IBERO también impulsó un Hackathon con participación de instituciones como UNAM, UAM, IPN e ITESM, orientado al desarrollo de proyectos para comprender y clasificar contenidos de redes sociales. El equipo ganador creó una especie de “emojipedia”, capaz de asociar emojis con sentimientos y emociones vinculados con discursos de odio.

IA para devolverle al usuario el control de lo que publica

El siguiente paso es colaborar con especialistas universitarios en discurso de odio para entrenar “agentes inteligentes” con bases de conocimiento amplias y perspectivas académicas diversas, apoyados por infraestructura especializada de un laboratorio de la Universidad Iberoamericana.

“En última instancia, el proyecto puede contribuir a mitigar los discursos de odio y la desinformación, no a través de la prohibición, sino ayudando a los usuarios, sobre todo a los jóvenes, para que identifiquen ese tipo de discurso, tomen conciencia de lo que significa y se hagan responsables de la decisión de usarlo o evitarlo”, refirió el doctor  Mauricio Flores Gerónimo.

En un ecosistema digital donde millones de mensajes circulan diariamente y donde una misma palabra puede cambiar de significado según quién la diga, dónde se publique y con qué intención, el reto para la inteligencia artificial ya no es solamente leer lo que escribimos, sino entender lo que realmente queremos expresar. (Valentina González Yáñez / IBERO Ciudad de México)

#OPINIÓN

SIGUIENDO LA PISTA
Diana Luisa Ramírez

Últimas Entradas

Sigue nuestras redes

@regionalpuebla