A Microsoft alertou internamente para o risco de a IA fragilizar a economia dos publishers

A relação entre a inteligência artificial generativa e os publishers soma uma nova frente. Documentos internos da Microsoft e da OpenAI, agora publicados sem determinadas partes censuradas na sequência de uma ação judicial apresentada por vários meios de comunicação norte-americanos, mostram que ambas as empresas tinham discutido internamente o risco de os modelos de IA acabarem por fragilizar economicamente as mesmas organizações cujo conteúdo utilizam. Entre os meios envolvidos está o Orlando Sentinel, que compilou algumas das comunicações incluídas no processo. Os documentos fazem referência a um possível “doom loop”, um círculo vicioso no qual os sistemas de inteligência artificial utilizam conteúdos jornalísticos para gerar respostas, reduzem potencialmente o tráfego e as receitas dos publishers e, como consequência, acabam por fragilizar a base económica que permite produzir novas fontes de informação.

Uma das comunicações internas da Microsoft reconhece explicitamente esta tensão: “É muito pouco habitual que um produto final ameace as bases económicas dos seus fornecedores essenciais, mas é essa a situação que criámos”. A frase aponta diretamente para um dos principais debates em torno da IA generativa: os modelos precisam de grandes quantidades de conteúdo de qualidade para serem treinados e responderem a consultas, mas, se uma parte crescente do consumo ocorrer dentro de interfaces de IA em vez de nos websites originais, o modelo económico que sustenta esse conteúdo pode ser afetado. A Microsoft chegou a descrever o processo como uma possível “apropriação massiva” do trabalho jornalístico. Outro dos documentos reúne declarações de Brent Hecht, Director of Applied Science da Microsoft, que aborda de forma particularmente crítica a relação entre os modelos e os conteúdos jornalísticos.

Segundo a documentação, Hecht afirmou que os sistemas de IA estavam a “aspirar” o trabalho produzido por milhões de jornalistas e chegou a considerar que o fenómeno poderia ser percecionado como “o maior roubo de trabalho da história da humanidade”. A Microsoft esclareceu estas afirmações, salientando que Hecht foi contratado precisamente para desempenhar uma função crítica ou de contraponto nos debates sobre inteligência artificial e que as suas opiniões não representam necessariamente a posição oficial da empresa. Este contexto é relevante porque os documentos não constituem uma admissão jurídica de que a Microsoft ou a OpenAI tenham infringido direitos de autor. Demonstram, contudo, que dentro das empresas existia uma discussão sobre os efeitos económicos e sociais que a utilização massiva de conteúdos externos pelos modelos poderia ter.

A documentação inclui também uma interação relacionada com a capacidade dos sistemas da OpenAI para aceder a conteúdos protegidos por paywalls. Segundo os documentos citados, Greg Brockman, presidente da OpenAI, respondeu com um “ah, bem” quando lhe mostraram que a tecnologia da empresa conseguia contornar determinados paywalls para obter conteúdo. A interação foi utilizada pelos advogados dos publishers como argumento no âmbito do processo. Steven Lieberman, advogado que representa o New York Daily News na ação judicial, defende que estas comunicações demonstrariam que as empresas tinham conhecimento tanto do acesso a conteúdos protegidos como dos possíveis danos económicos causados aos meios de comunicação. Esta interpretação faz parte da posição dos queixosos e não constitui uma conclusão judicial. A Microsoft e a OpenAI mantêm a sua defesa face às acusações apresentadas no processo. Segundo a informação disponibilizada, a OpenAI não fez comentários ao Orlando Sentinel sobre os novos documentos.

O debate sobre o “fair use” ganha outra dimensão

Uma das principais questões jurídicas em torno do treino de modelos generativos prende-se com determinar até que ponto a utilização de conteúdos protegidos pode estar abrangida pela doutrina norte-americana do fair use. Os publishers defendem que os seus conteúdos foram utilizados sem uma compensação adequada para desenvolver produtos comerciais capazes, em alguns casos, de substituir parte do consumo que anteriormente ocorria diretamente nas suas propriedades. As empresas tecnológicas, por sua vez, têm defendido em diferentes processos que o treino de modelos pode constituir uma utilização transformativa e que as respostas geradas não equivalem necessariamente à reprodução das obras originais.

Os novos documentos não resolvem essa discussão, mas acrescentam um elemento importante: mostram que dentro das próprias empresas era analisado o possível impacto económico dos modelos sobre as suas fontes de informação. Este aspeto poderá tornar-se relevante nos litígios, uma vez que parte do debate jurídico gira precisamente em torno do efeito que o novo produto pode ter sobre o mercado do conteúdo original.

O problema de fundo… Quem financia o conteúdo que alimenta a IA?

Para além das ações judiciais, a questão volta a colocar um problema estrutural para publishers e plataformas de inteligência artificial. Os modelos precisam de informação atualizada, fiável e especializada. Grande parte desse conteúdo provém de meios que financiam jornalistas, equipas editoriais, investigação, infraestrutura tecnológica e processos de verificação.

Se as interfaces generativas conseguirem responder a cada vez mais perguntas sem necessidade de encaminhar tráfego para as fontes originais, o valor do conteúdo pode separar-se progressivamente do local onde a sua produção é financiada. É precisamente esse o “doom loop” a que fazem referência as comunicações: a IA pode precisar de um ecossistema informativo saudável para funcionar, ao mesmo tempo que reduz parte dos incentivos económicos que permitem sustentá-lo.

A indústria já está a explorar possíveis respostas, desde acordos de licenciamento e compensação até mecanismos para limitar o acesso de determinados crawlers ou estabelecer novas fórmulas de atribuição e monetização. Mas os documentos agora conhecidos introduzem uma nuance relevante. O risco de a IA generativa poder prejudicar economicamente as suas próprias fontes não parece ter surgido apenas como uma crítica externa de publishers e jornalistas. Também estava a ser discutido dentro das empresas responsáveis pelo desenvolvimento desta tecnologia.

A questão que permanece em aberto é se o reconhecimento desse risco acabará por se traduzir em modelos económicos capazes de sustentar o conteúdo de que os sistemas de IA necessitam ou se, pelo contrário, publishers e plataformas continuarão a levar esta discussão para os tribunais, acordos individuais e negociações sobre quem capta, em última instância, o valor gerado pela informação.

Anterior
Anterior

A Azerion anuncia a unificação do seu negócio de supply sob a marca Improve Digital e lança uma solução 360º para publishers

Próximo
Próximo

As retail media networks procuram tornar-se canais de construção de marca