Estudo · Pesquisa acadêmica
Agentes de IA produziram mais anúncios, mas reduziram a diversidade
Um experimento com equipes humano-agente encontrou diferenças entre volume, qualidade textual e qualidade visual.
Um preprint de Harang Ju e Sinan Aral relata um experimento com 2.234 participantes na produção de anúncios. As equipes humano-agente produziram mais peças por pessoa e textos melhor avaliados, mas as equipes humanas tiveram imagens melhor avaliadas e maior diversidade entre anúncios.
- Acontecimento
- Publicação
- Última revisão
- Leitura
- 5 min
O que aconteceu
Um preprint de Harang Ju, da Johns Hopkins Carey Business School, e Sinan Aral, do MIT Sloan School of Management, investiga como agentes de IA afetam colaboração, produtividade e desempenho em uma tarefa de criação de anúncios. A versão consultada está no arXiv como 2503.18238v3. É um preprint, portanto não deve ser apresentado como resultado de artigo revisado por pares.
Os autores recrutaram 2.234 participantes nos Estados Unidos pela plataforma Prolific e os distribuíram aleatoriamente em equipes humano-humano ou humano-agente. Usando a plataforma experimental Pairit, essas equipes criaram anúncios para a campanha de um relatório anual de um think tank. A tarefa permitia editar texto, selecionar imagens, gerar imagens com DALL·E 3 e conversar em um espaço compartilhado. Ao todo, foram produzidos 11.024 anúncios.
O que mudou
Na medida de produtividade individual usada no estudo, participantes das equipes humano-agente enviaram 50% mais anúncios do que participantes das equipes humano-humano. Avaliadores humanos consideraram os textos das equipes com IA melhores, enquanto avaliaram as imagens das equipes exclusivamente humanas como melhores. Os anúncios feitos com agentes também foram mais homogêneos entre si.
A forma de trabalhar mudou junto com os resultados: as equipes humano-agente delegaram 17% mais trabalho ao agente e fizeram 62% menos edições diretas de texto. O estudo também registrou 25% mais mensagens orientadas à tarefa e 18% menos mensagens sociais e emocionais nessas equipes. Esses valores descrevem a atividade observada na plataforma e naquela tarefa publicitária.
Por que importa
O achado ajuda a separar quatro perguntas que costumam ser tratadas como uma só: a equipe entregou mais peças? O texto melhorou? A imagem melhorou? As peças continuaram distintas? Neste experimento, o aumento de volume e a qualidade textual coexistiram com menor diversidade e avaliação inferior das imagens.
No teste de campo, os anúncios receberam cerca de 4,9 milhões de impressões no X. A qualidade textual se associou a melhores taxas de clique e duração de visualização; a qualidade das imagens se associou a menor custo por clique. O tipo de equipe, por si só, não produziu diferença direta significativa em algumas métricas de visualização; o desempenho geral da campanha foi semelhante entre as condições. Portanto, o estudo não sustenta que equipes com agentes sempre gerem campanhas melhores.
Para quem importa
A pauta é relevante para líderes de marketing, conteúdo e criação que testam agentes capazes de agir em um espaço de trabalho, editar materiais e gerar imagens. Também interessa a quem mede a produção de equipes por volume e precisa saber se a escala preserva a variedade da comunicação.
O paralelo com outras atividades criativas deve ser tratado como hipótese. O experimento mediu anúncios de uma campanha específica, não projetos de marca, arquitetura, atendimento, desenvolvimento de software ou produção editorial.
Impacto prático
Para uma empresa, o uso mais direto do estudo é desenhar um piloto com métricas de produção e diferenciação separadas. Além de contar entregas e tempo, a equipe pode avaliar clareza do texto, adequação das imagens, variedade entre peças e quantidade de ajustes antes da aprovação.
Se a ferramenta elevar o número de versões, a etapa de seleção ganha peso: alguém precisa verificar se cada peça representa uma ideia útil e coerente com a marca. O experimento também mostra que a qualidade pode variar por modalidade. Uma boa avaliação de texto não substitui a checagem visual.
O que testar
Monte um teste controlado com um briefing realista, mas sem dados sensíveis, e compare uma equipe humana com uma equipe que trabalhe com o agente em ambiente semelhante. Defina previamente critérios de avaliação e use avaliadores que não saibam qual condição produziu cada anúncio.
Meça peças completas por participante, tempo, qualidade de texto e imagem, similaridade entre as peças e retrabalho. Depois, compare os resultados com o fluxo atual. Não use o aumento de 50% como meta empresarial: no paper, ele significa anúncios enviados por indivíduo naquele experimento, não produtividade geral, receita ou retorno financeiro.
O que observar
Observe quais partes do trabalho foram delegadas e quais foram revisadas por pessoas. No estudo, equipes com IA editaram menos texto diretamente; isso pode ajudar a explicar a escala, mas também aumenta a importância de verificar conteúdo e coerência antes da publicação.
Acompanhe diversidade ao longo de várias peças, não só a qualidade de uma peça isolada. Se os resultados convergirem para fórmulas repetidas, a equipe pode introduzir referências diferentes, restrições criativas ou rodadas humanas de edição e avaliar se isso reduz a homogeneidade.
O que ainda não sabemos
Os próprios autores apontam limites: não houve condição de comparação com uma pessoa trabalhando sozinha, então o estudo não isola a contribuição marginal da IA em relação ao trabalho individual. Algumas relações entre reconhecer o agente, delegar e obter qualidade foram analisadas de forma correlacional, com explicações alternativas possíveis. Além disso, os resultados podem mudar à medida que modelos e ferramentas evoluem.
A plataforma experimental, o agente baseado em GPT-4o de 2024, o acesso a DALL·E 3, a tarefa de publicidade de um think tank e o mercado de anúncios no X formam um recorte específico. O preprint não demonstra efeitos em outras empresas, setores, ferramentas, campanhas ou colaborações prolongadas. Trate os achados como evidência inicial para orientar um piloto, não como previsão universal.
Fontes
- Collaborating with AI Agents: Field Experiments on Teamwork, Productivity, and PerformancearXiv · Paper · publicada em 23 de março de 2025 · conferida em 24 de setembro de 2026