Ir al contenido

Investigación

Académica U. de Chile desarrolla modelo de IA que explica por qué detecta discurso de odio

Académica Uchile desarrolla IA que explica detección de discurso de odio
Uso de IA
El nuevo modelo busca que los sistemas de inteligencia artificial puedan explicar por qué identifican determinados contenidos como discurso de odio.
fcfm
“Buscamos contribuir al desarrollo de modelos de lenguaje más interpretables, seguros y alineados con los valores humanos”, dice Francielle Vargas, académica de la FCFM y de IDIA.

Detectar discurso de odio en redes sociales es una tarea cada vez más compleja para los sistemas de inteligencia artificial: no solo deben identificar contenido ofensivo, sino también explicar por qué lo consideran así, evitando sesgos y decisiones opacas. En esa línea se inscribe la investigación que Francielle Vargas, académica de la Facultad de Ciencias Físicas y Matemáticas (FCFM) y de la Iniciativa de Datos e Inteligencia Artificial (IDIA) de la Universidad de Chile, presentó recientemente en ACL 2026, la 64ª reunión anual de la Association for Computational Linguistics, considerada la conferencia científica más importante del mundo en procesamiento del lenguaje natural (NLP).

La investigación titulada "Self-Explaining Hate Speech Detection with Moral Rationales" fue liderada por Vargas, desarrollada junto a un equipo internacional de investigadores e investigadoras de la University of Southern California, Saarland University, University of Melbourne, Virginia Tech, Pennsylvania State University, Technical University of Munich, Portland State University y Google Research, y fue aceptada en la sección Findings of ACL 2026.

Un modelo que explica sus propias decisiones

La propuesta central del artículo es Supervised Moral Rationale Attention (SMRA), un framework "self-explaining" de inteligencia artificial con interpretabilidad intrínseca, capaz de generar la explicación de su decisión como parte integral de su propio proceso de toma de decisiones -en lugar de calcularla posteriormente mediante un método separado- y que incorpora directamente en el entrenamiento de modelos de lenguaje basados en transformers justificaciones morales anotadas por especialistas.

A diferencia de los clasificadores tradicionales de discurso de odio, que suelen apoyarse en marcadores léxicos superficiales y son vulnerables a correlaciones espurias, SMRA se basa en la Teoría de los Fundamentos Morales (Moral Foundations Theory) para guiar la atención del modelo hacia los fragmentos de texto que efectivamente sustentan un juicio moral (por ejemplo, expresiones vinculadas a daño, deslealtad o degradación). Esto se traduce en explicaciones más fieles al razonamiento del modelo y más plausibles para una persona, sin sacrificar precisión predictiva.

Los resultados muestran que SMRA mejora de forma consistente tanto el desempeño predictivo como la calidad de las explicaciones, medida en términos de fidelidad (faithfulness) y plausibilidad (plausibility), frente a modelos base y a enfoques previos de atención supervisada, manteniendo además la equidad (fairness) del modelo entre distintos grupos sociales.

La investigación propone un modelo para que los sistemas de moderación de contenido sean más transparentes, culturalmente conscientes y confiables, una propuesta que los propios autores destacan como necesaria antes de cualquier despliegue real de estos sistemas, subrayando la importancia de salvaguardas adicionales y una gobernanza responsable.

Relevancia para una IA más transparente, segura y confiable

"Presentar este trabajo en ACL representa una oportunidad para visibilizar la investigación que desarrollamos en la Universidad de Chile, fortalecer la colaboración con la comunidad científica internacional y contribuir al desarrollo de modelos de lenguaje más interpretables, seguros y alineados con los valores humanos", señaló la académica Francielle Vargas.

Además de presentar su investigación, Vargas participó como chair (encargada de coordinar la sesión) de "Safety and Alignment in Large Language Models" de ACL 2026, conduciendo la discusión de trabajos de vanguardia sobre seguridad, alineamiento y confiabilidad de grandes modelos de lenguaje (LLMs). Esta participación constituye un reconocimiento a su trayectoria por parte de la comunidad internacional de NLP.

Con esta participación, la Facultad de Ciencias Físicas y Matemáticas reafirma su compromiso con el desarrollo de investigación de frontera en inteligencia artificial y con el fortalecimiento de la colaboración científica internacional en áreas de alto impacto social.