Artigo - All too perfect: bias and aspiration in persona generation with LLMs
Inteligência Artificial
Resumo
Dados sintéticos gerados por grandes modelos de linguagem desempenham um papel central no processo de treinamento e alinhamento de outros sistemas de IA. No entanto, esse processo também corre o risco de herdar os vieses estruturais de corpora orgânicos e embutir novos vieses que decorrem das escolhas de design subjacentes ao processo de criação de dados. Este artigo examina os vieses sistemáticos que surgem quando grandes modelos de linguagem (LLMs) são encarregados de gerar personas sintéticas.
Introduzimos um pipeline reprodutível e minimamente condicionado que produziu 40.000 personas, em quatro idiomas diferentes, utilizando dois geradores de pesos abertos ajustados por instrução (Llama-3.3-70B-Instruct e Qwen2.5-72B-Instruct), seguido de uma bateria de análises quantitativas: taxas de correspondência de nomes, divergência/inclinação KL para gênero, comparações de pirâmides etárias, interseccionalidade profissão-gênero, perfil de adjetivos/sentimento e classificação de papéis proppianos.
Nossos principais achados revelam que as gerações de personas estão longe de ser neutras. Os modelos tendem a focar em personagens de meia-idade, aspiracionais e predominantemente positivos (ou seja, animados/otimistas), enquanto identidades não binárias e muitas ocupações do mundo real permanecem sub-representadas. Concluímos que os regimes contemporâneos de treinamento e alinhamento produzem uma forma de higienização narrativa que tanto achata a diversidade representativa quanto incorpora pressupostos normativos, e propomos que a avaliação baseada em personas pode servir como um diagnóstico escalável do que os sistemas generativos valorizam e priorizam ao retratar a humanidade
Objetivo
O objetivo é qualificar o debate técnico e oferecer subsídios para compreender o que os sistemas gerativos valorizam e priorizam ao retratar a humanidade, propondo que a avaliação baseada em personas sirva como um diagnóstico escalável.
Acesse o artigo neste link:
https://link.springer.com/article/10.1007/s10462-026-11641-3