A marca d'água que ninguém vê
A OpenAI anunciou nesta semana que começará a aplicar uma forma de marca d'água invisível nos textos gerados pelo ChatGPT e pelo Codex para usuários da União Europeia. O recurso, chamado internamente de textGrain, não consiste num símbolo visível nem num texto oculto — em vez disso, o modelo altera sutilmente o padrão estatístico de suas escolhas de palavras, de modo que um detector especializado possa identificar, após a leitura, se o trecho foi produzido por um sistema da OpenAI.
A decisão é uma resposta direta às regras de transparência da Lei de IA da Europa (EU AI Act), que entraram em vigor em 2º de agosto de 2026 e exigem que os provedores de inteligência artificial tornem os conteúdos gerados identificáveis por meio de marcas legíveis por máquina. A data-limite para a conformidade total do Artigo 50 é 2 de dezembro de 2026.
Como o textGrain funciona (e onde ele falha)
O funcionamento do textGrain é, na prática, uma variação sofisticada de técnicas de watermarking que já circulam no meio acadêmico desde 2023. Grandes modelos de linguagem selecionam tokens de palavras sequencialmente a partir de uma distribuição de probabilidade. O textGrain modifica levemente essa distribuição, favorecendo periodicamente palavras sinônimas que preservam o sentido original mas desviam o texto de um padrão estatístico "não marcado". Um detector, alimentado por uma chave secreta, busca por esse desvio vocabular e emite um sinal indicativo de autoria por IA.
Na teoria, a marca d'água viaja junto com o texto quando ele é copiado e colado — algo que diferencia essa abordagem de marcas visuais ou metadados que se perdem na transferência. Na prática, porém, os resultados são inconsistentes. A própria OpenAI reconheceu, em seu anúncio, que passagens curtas (cerca de 200 palavras) são detectadas com apenas 80% de taxa de acerto, contra 95% em passagens de 400 palavras. Para textos funcionais, como código ou explicações matemáticas, a detecção cai ainda mais, pois substituições sinônimas introduzem erros que o modelo evitaria.
Testes realizados por The Register revelaram um ponto ainda mais frágil: a marca d'água pode ser derrotada com uma simples substituição de palavras. Em passagens de 400 tokens, trocar 10% dos termos por sinônimos reduziu a detecção de 92% para 66%. Com 25% de substituição, a marca d'água só foi detectada em 17% dos casos. Ou seja, o mínimo esforço de edição humana torna a técnica praticamente inócua.
Por que só na Europa?
A abordagem geográfica da OpenAI não é gratuita. A empresa citou a necessidade de "aprender com o uso real e o feedback" antes de expandir para outras regiões. Mas há outras motivações. Diferentemente da Anthropic, que vem adotando marcas d'água em seus outputs globalmente, a OpenAI decidiu manter o watermarking como opção (opt-in) para clientes da API fora da UE e como padrão apenas na Europa. Para clientes globais da API, a funcionalidade permanece desligada por padrão a partir de 5 de outubro de 2026.
A decisão reflete um dilema que afeta todo o setor: marcas d'água em texto têm sido historicamente mais problemáticas do que em imagens ou vídeos, onde técnicas como o SynthID da Google já mostraram resultados mais robustos. A Microsoft e a Meta, por exemplo, já aplicam sinais de proveniência semelhantes a imagens geradas por IA, mas a detecção de texto continua sendo um problema aberto.
O que a marca d'água NÃO faz
A OpenAI foi explícita em suas ressalvas. A marca d'água pode indicar que um sistema da OpenAI "gerou ou processou parte de um trecho", mas não quantas decisões humanas, edição criativa ou julgamento subjetivo foram aplicados ao resultado. Além disso, a empresa afirmou que a marca não estabelece propriedade ou responsabilidade pelo conteúdo, não identifica quem gerou o texto e não verifica a precisão factual.
O detector do textGrain também não funciona como um serviço universal — a OpenAI está limitando o acesso inicialmente a pesquisadores aprovados e organizações sob o Código de Prática europeu sobre transparência de conteúdo gerado por IA. Isso significa que, no momento, não há uma ferramenta pública de verificação acessível a jornalistas, plataformas ou leitores comuns.
O que vem por aí
A empresa anunciou que pretende tornar o textGrain open-source em breve, o que pode acelerar a adoção da técnica por terceiros — mas também criar ferramentas de evasão mais sofisticadas. O SynthID da Google, para comparação, já está disponível globalmente e ganhou uma interface web dedicada, lançada na mesma semana.
Enquanto isso, a OpenAI continua trabalhando com parceiros de cloud para oferecer watermarking em modelos acessados por meio de seus serviços, o que pode ser significativo para o setor: grande parte do tráfego empresarial nunca toca a interface própria do ChatGPT.
O problema que a indústria ainda não resolveu
A marca d'água estatística de texto é, no fundo, uma solução para um problema que ainda não tem solução definitiva. Se o objetivo é combater desinformação gerada por IA, a técnica falha quando aplicada a textos curtos, editados ou traduzidos — exatamente os casos em que a detecção importa mais. E se o objetivo é apenas cumprir a legislação europeia, então a escolha de restringir o recurso à UE pode se mostrar uma decisão estratégica de longo prazo: aprender em um mercado regulado sem arriscar a experiência do usuário em outras regiões.
A pergunta que fica é se as marcas d'água de texto, dada a fragilidade demonstrada, serão um padrão permanente no ecossistema ou uma etapa temporária até que a indústria encontre um mecanismo verdadeiramente confiável — e, nesse meio tempo, quantos usuários da UE vão continuar gerando textos imunes a qualquer verificação com uma simples troca de sinônimos.
Fontes: TechCrunch, The Register, The Next Web
✓ Fontes independentes cruzadas e verificadas antes da publicação