A OpenAI prevê incorporar marcas-d’água invisíveis a textos gerados pelo ChatGPT e pelo Codex para usuários elegíveis da União Europeia nas próximas semanas. A empresa apresentou a medida como parte de sua resposta às exigências de transparência vinculadas à legislação europeia sobre inteligência artificial, embora o sinal técnico, por si só, não seja uma prova conclusiva de que uma pessoa ou um modelo tenha escrito um texto.
A tecnologia se chama textGrain. Em vez de adicionar caracteres visíveis ou elementos ocultos à formatação, ela incorpora um sinal estatístico à seleção de palavras do modelo. Um detector pode procurar esse padrão no texto e estimar se ele contém uma marca da OpenAI.
A implementação será diferente nos produtos e na API
No ChatGPT e no Codex, a marca será adicionada às saídas de usuários elegíveis da UE, de acordo com o anúncio da OpenAI. A empresa não especificou, nas informações disponíveis, quais critérios determinam essa elegibilidade.
Para determinados modelos de sua API, por outro lado, clientes do mundo todo poderão ativar a marcação voluntariamente. O recurso permanecerá desativado por padrão. A OpenAI também informou que está trabalhando para oferecer a marca por meio de provedores de serviços em nuvem, mas não detalhou aqui o alcance dessa disponibilidade.
Inicialmente, o acesso ao detector será restrito: pesquisadores e organizações especializadas aprovados poderão solicitá-lo. Portanto, o fato de uma saída estar marcada não significa que qualquer destinatário possa verificá-lo diretamente com uma ferramenta pública.
A detecção depende do texto e de como ele foi editado
A OpenAI descreve o textGrain como uma tecnologia ainda incipiente e alerta que ele pode gerar falsos positivos — detectar uma marca onde ela não existe — e falsos negativos — não detectar uma marca presente. Seu desempenho também varia conforme o comprimento e o tipo de conteúdo. Textos curtos e técnicos podem oferecer menos margem para que o modelo incorpore um padrão estatístico reconhecível.
Em avaliações divulgadas pela empresa, o detector identificou cerca de 80% dos trechos de 200 tokens e 95% dos trechos de 400 tokens em testes com conteúdo de psicologia, com uma taxa-alvo de falsos positivos de 1%. São resultados de avaliação obtidos em condições específicas, não uma garantia de precisão em qualquer texto ou uso cotidiano.
A edição pode enfraquecer consideravelmente o sinal. Em um teste citado pela OpenAI, substituir por sinônimos 25% das palavras de trechos de 400 tokens reduziu a detecção de 92% para 17%. O resultado demonstra uma limitação do sistema diante de alterações no texto; não permite concluir que todos os tipos de edição produzam a mesma queda.
O que uma marca pode — e não pode — indicar
Uma detecção positiva pode indicar que o texto apresenta o padrão associado a uma marca da OpenAI. Ela não identifica o usuário, não revela suas instruções, não determina quanto trabalho humano houve nem comprova quem detém os direitos sobre o conteúdo. Tampouco verifica se as informações estão corretas.
Por outro lado, o fato de o detector não encontrar o sinal não demonstra que uma pessoa tenha escrito o texto. Ele pode não detectá-lo devido à brevidade ou ao tipo de conteúdo, a alterações posteriores ou porque o texto foi gerado por um modelo que não incorpora o textGrain.
A OpenAI situa a implementação no contexto das obrigações de transparência da Lei de IA da UE. Essa relação deve ser entendida como o marco que a empresa invoca para explicar sua decisão: as informações disponíveis não permitem afirmar que a norma obrigue a marcar dessa maneira específica cada texto gerado. A marca é uma ferramenta técnica de identificação, com limitações reconhecidas pela própria empresa, e não substitui outras formas de avaliar a origem, a responsabilidade ou a confiabilidade de uma publicação.