Uma obrigação legal vira produto
A OpenAI confirmou, em comunicado oficial publicado nesta segunda-feira, que vai inserir uma marca d'água invisível em textos gerados por ChatGPT e Codex dentro da União Europeia. A medida responde a uma exigência direta da Lei de IA do bloco europeu, que obriga provedores de inteligência artificial generativa a tornar textos gerados por máquina identificáveis de forma legível por sistemas automáticos. Nas próximas semanas, usuários europeus de planos pagos e gratuitos do ChatGPT, além de quem usa o Codex, assistente de programação da empresa, vão gerar textos com esse sinal embutido sem perceber qualquer mudança na experiência.
O que é o textGrain
A tecnologia se chama textGrain e funciona inserindo um sinal estatístico nas escolhas de palavras do modelo: pequenas preferências lexicais, invisíveis a olho nu, mas detectáveis por um classificador da própria OpenAI. Segundo a empresa, o textGrain igualou ou superou o desempenho do SynthID para texto, a marca d'água do Google DeepMind, nos testes internos, sem perda perceptível de qualidade nas respostas do Astra, modelo mais recente da companhia. A OpenAI também afirmou que vai abrir o código da tecnologia, movimento que pode acelerar a adoção por outros laboratórios e tirar a provenança de texto do terreno proprietário.
Fora da União Europeia, o recurso é opcional
A parte mais relevante para quem usa a API fora da Europa é que a marca d'água chega desligada por padrão e só é ativada por escolha do cliente, em modelos selecionados. Isso transforma uma obrigação regulatória europeia em ferramenta de transparência que desenvolvedores em qualquer lugar do mundo podem ligar se quiserem provar a origem do texto que entregam a seus próprios usuários. A OpenAI também abriu candidatura para pesquisadores e organizações especializadas acessarem o detector, mas deixou claro que o acesso começa restrito e avaliado caso a caso, justamente pelos riscos de interpretação errada do resultado.
Os números que a própria OpenAI expõe
O comunicado é incomum por admitir, com dados, o quanto a tecnologia ainda falha. Em textos de 200 tokens, unidades de processamento que normalmente equivalem a pedaços de palavras, a taxa de detecção fica perto de 80%. Em textos de 400 tokens sobe para 95%, mas cai bastante em conteúdos técnicos como matemática, onde há menos liberdade de escolha de palavras. Edição também destrói o sinal rápido: trocar 10% das palavras por sinônimos derruba a detecção de 92% para 66%, e trocar 25% reduz para 17%. A empresa resume o recado de forma direta: a ausência de marca d'água detectada não prova autoria humana, e a presença dela não identifica quem escreveu, não comprova propriedade do texto e não diz se o conteúdo é verdadeiro.
A leitura do MaxAssistant
Texto é o material mais difícil de rastrear em toda a produção de IA generativa porque pode ser reescrito, traduzido e editado sem perder sentido, ao contrário de imagem e áudio, onde metadado e marca d'água resistem melhor. A OpenAI reconhece essa fragilidade ao limitar o lançamento obrigatório à Europa e manter o resto do mundo em modo de teste opcional. É um movimento de conformidade regulatória fatiado com cuidado, não uma cruzada voluntária por transparência: a empresa já tinha outras ferramentas de proveniência para imagem e áudio havia meses, e só agora endereça texto, a frente mais difícil e mais pressionada pela lei europeia.
Fontes
- 1.OpenAI: nossa abordagem para proveniência de texto na UE. openai.com
Encontrou um erro? Consulte nossa política de correções.
Quer aplicar isso na sua empresa?Conte pelo WhatsApp o que sua empresa quer resolver. A Max M implementa com você.
Fale com a Max M

