Claude passa a marcar texto gerado por IA com watermark invisível

A Anthropic implementou um sistema de watermarking imperceptível no Claude para identificar texto gerado por IA. A tecnologia sobrevive a copiar-colar e até a pequenas edições.

Já estamos habituados a ver watermarks em imagens criadas por inteligência artificial, mas agora o mesmo princípio chega ao texto. A Anthropic, empresa responsável pelo Claude, assinou o Código de Práticas da União Europeia sobre Transparência de Conteúdo Gerado por IA e explica como funciona esta marcação invisível que identifica tudo o que sai dos seus modelos.

A ideia é simples: tornar mais fácil para qualquer pessoa perceber quando um comentário, artigo ou resposta online foi escrito por um sistema de inteligência artificial, em vez de por um humano.

Como funciona o watermark invisível

Ao contrário das marcas de água que vemos em fotografias, este watermark no texto é completamente imperceptível para quem lê. Quando um modelo Claude gera uma resposta, a marca fica tecida diretamente no próprio texto não altera o significado, não mexe na qualidade e não se nota na leitura.

O mais interessante é a resiliência da tecnologia: a marca sobrevive quando copias e colas o texto noutro sítio qualquer. Mais ainda, aguenta até pequenas edições ao conteúdo, o que significa que não basta mudar meia dúzia de palavras para enganar o sistema. Só textos muito curtos ou conteúdo que tenha sido muito editado é que conseguem escapar à deteção.

marcar texto gerado por IA Claude

Todos os modelos lançados na UE desde agosto

A marcação automática já está ativa em todos os modelos Claude que foram lançados na União Europeia a partir de 2 de agosto data em que o Código entrou em vigor. O watermark é aplicado pelo próprio modelo, independentemente de estares a usar a API do Claude, o Claude Code, Cowork ou Tag.

Também não interessa qual é o fornecedor de serviços: seja AWS, Google Cloud ou Microsoft Foundry, o sistema funciona da mesma forma. A Anthropic está ainda a trabalhar para adicionar esta funcionalidade aos modelos mais antigos (anteriores a 2 de agosto) e vai implementá-la globalmente, não apenas dentro da UE.

Ferramentas de deteção a caminho

Para complementar o sistema de watermarking, a empresa está a desenvolver ferramentas que vão ajudar as pessoas a detetar estas marcas invisíveis. Ainda não há data concreta, mas a ideia é disponibilizar estes recursos em breve para que qualquer utilizador possa verificar se um texto passou ou não por um modelo Claude.

Um detalhe importante: o watermark é aplicado a TUDO o que sai do Claude, mesmo quando a IA não é o autor original do conteúdo. Se usares o Claude para traduzir, resumir, formatar ou rever um texto que tu próprio escreveste, o resultado final vai ficar marcado na mesma.

Uma precaução extra além do código europeu

Esta decisão da Anthropic vai além do que o Código de Práticas da UE exige. O documento europeu tem uma exceção específica para funções auxiliares que apenas editam ou não alteram substancialmente o input original mas a empresa preferiu marcar tudo, por precaução.

Imagens também ganham proveniência verificável

No caso das imagens geradas por IA, o watermark visual que se consegue apagar facilmente vai dar lugar a metadados de proveniência assinados, embutidos nos próprios ficheiros JPG, PNG e SVG. Este sistema baseia-se no padrão aberto desenvolvido pela Coalition for Content Provenance and Authenticity (C2PA), que permite verificar a origem e autenticidade de conteúdo visual.

Benefícios para todos, inclusive para as próprias IA

Facilitar a identificação de conteúdo gerado por inteligência artificial é claramente positivo para os consumidores, mas as próprias empresas de IA também ganham com isto. À medida que bots inundam a internet com comentários e artigos inteiros, há um risco crescente: os novos modelos de IA podem acabar a treinar-se com texto escrito por modelos antigos de IA, criando um ciclo de degradação da qualidade.

Basicamente o Claude passa a marcar texto gerado por IA, e assim com sistemas de watermarking robustos, as empresas conseguem filtrar este conteúdo sintético dos seus conjuntos de treino. No fim de contas, é uma medida que protege tanto quem consome informação online como quem desenvolve a próxima geração destes sistemas.

Via: androidauthority

Bruno Xarope
Bruno Xarope

Bruno Xarope escreve sobre tecnologia, smartphones, mobilidade elétrica e inovação no CtrlShift.pt. Acompanha diariamente as novidades do setor e testa regularmente novos equipamentos, partilhando análises, opiniões e primeiras impressões.

Artigos: 1720

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *