Marca d’água no ChatGPT: OpenAI lança tecnologia textGrain na UE

Escrito por
Jardeson Márcio
Jardeson Márcio é Jornalista e Mestre em Tecnologia Agroalimentar pela Universidade Federal da Paraíba. Com 8 anos de experiência escrevendo no SempreUpdate, Jardeson é um especialista...

OpenAI adota marcas d'água invisíveis no ChatGPT e Codex para atender regras da Europa.

A OpenAI começou a implementar uma marca d’água invisível no ChatGPT e no Codex para identificar conteúdos gerados por seus sistemas de inteligência artificial na União Europeia. A tecnologia, chamada textGrain, cria um padrão estatístico no texto sem inserir caracteres ocultos, símbolos especiais ou elementos visíveis para o usuário.

A iniciativa está relacionada às novas exigências de transparência do AI Act, a legislação de inteligência artificial da União Europeia. A proposta é permitir que determinados conteúdos gerados por IA possam ser identificados posteriormente, mesmo quando parecem textos convencionais para quem os lê.

A novidade, porém, está longe de representar um método infalível de identificação. Os próprios testes divulgados pela OpenAI mostram que edições, paráfrases, textos muito curtos e determinados tipos de conteúdo podem reduzir significativamente a eficiência da detecção.

Como funciona a marca d’água no ChatGPT

O textGrain utiliza uma abordagem estatística para inserir a marca d’água durante a geração do conteúdo. Em vez de adicionar alguma informação escondida ao arquivo ou ao texto, a tecnologia influencia discretamente as escolhas de palavras realizadas pelo modelo.

Quando existem diferentes palavras ou construções possíveis para formar uma frase, o sistema pode favorecer determinadas opções de maneira controlada. Uma escolha isolada não seria suficiente para identificar qualquer coisa, mas milhares de decisões acumuladas podem formar um padrão estatístico reconhecível.

Isso significa que o usuário continua vendo um texto aparentemente normal. Não há uma sequência de caracteres invisíveis para copiar, um código secreto no final do documento ou uma identificação pessoal incorporada à resposta.

A OpenAI também disponibiliza a tecnologia por meio de sua API, permitindo que desenvolvedores utilizem o mecanismo globalmente em modelos compatíveis. Nesse caso, a marca d’água permanece desativada por padrão, enquanto a implementação relacionada às exigências europeias segue regras específicas.

O acesso ao detector também é mais restrito. A empresa pretende trabalhar inicialmente com pesquisadores e organizações parceiras, antes de ampliar a disponibilidade da ferramenta.

Operator ChatGPT

Por que a marca d’água invisível pode perder eficiência

A principal fragilidade do sistema aparece quando o texto deixa de ser exatamente aquele produzido pelo modelo.

Um usuário pode, por exemplo, substituir algumas palavras por sinônimos, reorganizar frases, remover trechos ou reescrever determinados parágrafos. Essas modificações alteram justamente o padrão estatístico que o textGrain tenta reconhecer.

Os testes apresentados pela OpenAI mostram uma redução importante na capacidade de identificação quando o conteúdo passa por processos de edição e paráfrase. Portanto, quanto mais o texto original é modificado, maior pode ser a dificuldade para recuperar o sinal deixado durante sua geração.

Isso cria uma situação curiosa. Um artigo produzido integralmente pelo ChatGPT pode apresentar uma marca detectável, mas uma versão posteriormente revisada por uma pessoa pode apresentar um sinal muito mais fraco.

A questão é especialmente relevante para jornalistas, estudantes, desenvolvedores e profissionais que utilizam inteligência artificial como ferramenta de apoio. Na prática, muitos conteúdos não são simplesmente gerados e publicados. Eles passam por revisão, correção, tradução, edição e adaptação.

Textos curtos também são um desafio

Outro problema está relacionado ao tamanho do conteúdo.

Uma marca d’água estatística precisa de informações suficientes para distinguir seu padrão do comportamento normal da linguagem. Em textos muito pequenos, existe menos material para análise e, consequentemente, maior dificuldade para obter uma conclusão confiável.

A situação fica ainda mais complicada em conteúdos nos quais existe pouca liberdade para escolher palavras diferentes.

Textos matemáticos e outros conteúdos técnicos altamente restritos, por exemplo, podem oferecer menos variação vocabular para que o sistema introduza seu padrão estatístico sem alterar a resposta esperada.

Isso ajuda a explicar por que uma tecnologia desse tipo não pode ser tratada como um detector universal de inteligência artificial.

A marca d’água não identifica quem escreveu o texto

Existe ainda uma diferença fundamental entre detectar a origem de um conteúdo e identificar seu autor.

Mesmo quando o sinal do textGrain é encontrado, ele não permite concluir quem utilizou o ChatGPT para produzir determinado material. A tecnologia também não informa automaticamente qual porcentagem do conteúdo foi escrita por uma pessoa ou por inteligência artificial.

Da mesma forma, a ausência de uma marca detectável não significa necessariamente que um texto tenha sido produzido por um ser humano.

Esse ponto é importante porque classificadores de IA já enfrentam problemas de falsos positivos e falsos negativos. Um sistema de detecção pode errar nos dois sentidos, especialmente quando trabalha com textos curtos ou modificados.

Por isso, o resultado de uma ferramenta de detecção deve ser tratado como um indicador de procedência, e não como uma prova definitiva de autoria.

Privacidade não depende de informações pessoais

Um dos aspectos mais importantes da implementação é que a marca d’água não precisa armazenar informações pessoais para funcionar.

Segundo a OpenAI, o mecanismo não incorpora ao texto o prompt utilizado pelo usuário, dados da conta ou identificadores pessoais. O sinal está relacionado ao padrão estatístico utilizado durante a geração.

Na prática, isso significa que a tecnologia não funciona como uma espécie de número de série individual associado a cada usuário.

Essa característica é especialmente relevante em um cenário no qual empresas e governos buscam mecanismos de rastreamento de conteúdo produzido por inteligência artificial sem transformar cada resposta em um registro de identidade.

O impacto para desenvolvedores que usam o Codex

A mudança também alcança o Codex, ferramenta da OpenAI voltada para tarefas relacionadas ao desenvolvimento de software.

Para programadores, porém, a aplicação de marcas d’água apresenta desafios diferentes dos encontrados em textos convencionais. Código-fonte possui uma estrutura muito mais rígida, e determinadas linguagens oferecem poucas maneiras equivalentes de expressar exatamente a mesma operação.

Além disso, o código costuma ser posteriormente formatado, otimizado, refatorado e combinado com contribuições humanas.

Isso torna particularmente importante separar a ideia de procedência de uma suposta capacidade de determinar exatamente quem escreveu cada linha de um projeto.

A própria regulamentação europeia também possui regras e exceções específicas para conteúdos como código-fonte, dependendo do contexto em que a inteligência artificial é utilizada.

Como o AI Act influencia a decisão da OpenAI

A implementação europeia está diretamente relacionada ao AI Act, legislação criada pela União Europeia para estabelecer regras sobre o desenvolvimento e utilização de sistemas de inteligência artificial.

Entre suas exigências de transparência estão mecanismos destinados a permitir que determinados conteúdos sintéticos possam ser identificados como produzidos ou manipulados por IA.

A estratégia da OpenAI representa uma tentativa de cumprir essas obrigações por meio de uma tecnologia que atua durante a própria geração do conteúdo.

Em vez de tentar descobrir posteriormente se um texto “parece” ter sido escrito por IA, a abordagem busca inserir um sinal de procedência desde o momento em que a resposta é criada.

Essa diferença é importante. Detectores tradicionais dependem da análise do conteúdo final, enquanto uma marca d’água estatística acompanha o processo de geração.

Uma solução importante, mas ainda longe de ser perfeita

A chegada do textGrain representa um passo relevante na discussão sobre a procedência de conteúdos gerados por inteligência artificial. A tecnologia oferece uma alternativa aos sistemas que simplesmente tentam adivinhar se determinado texto foi produzido por uma máquina.

Ao mesmo tempo, suas limitações mostram por que marcas d’água invisíveis não devem ser tratadas como provas absolutas.

Edições, paráfrases, textos curtos e conteúdos com baixa variação linguística podem dificultar a identificação. Além disso, a tecnologia não determina quem utilizou o modelo nem quanto de participação humana existiu na produção de um conteúdo.

Para usuários e desenvolvedores, a mudança também mostra como o AI Act europeu já está influenciando diretamente a forma como grandes empresas de inteligência artificial desenvolvem seus produtos.

O verdadeiro teste para o textGrain será sua utilização no mundo real. Se alterações relativamente simples conseguirem enfraquecer significativamente o sinal, será necessário avaliar até que ponto a tecnologia consegue cumprir seu objetivo em conteúdos que passam por revisão e edição antes da publicação.

Compartilhe este artigo
Jardeson Márcio é Jornalista e Mestre em Tecnologia Agroalimentar pela Universidade Federal da Paraíba. Com 8 anos de experiência escrevendo no SempreUpdate, Jardeson é um especialista em Android, Apple, Cibersegurança e diversos outros temas do universo tecnológico. Seu foco é trazer análises aprofundadas, notícias e guias práticos sobre segurança digital, mobilidade, sistemas operacionais e as últimas inovações que moldam o cenário da tecnologia.