A principios de esta semana, Anthropic anunció la incorporación de una marca de agua invisible en los textos generados por su modelo Claude, disponible globalmente a partir del 2 de agosto, tras su lanzamiento en la Unión Europea. Este sistema, que no utiliza metadatos y permanece presente en el texto incluso si se copia, ha generado reacciones enérgicas, incluyendo amenazas de cancelación de suscripciones. Dario Amodei, CEO de Anthropic, ofreció detalles sobre su funcionamiento, aclarando la intención de identificar qué contenido podría haber sido generado por Claude sin afectar la experiencia de lectura o escritura.
El sello invisible no agrega caracteres ni contenido oculto. En su lugar, la marca se integra en el proceso de generación del texto, de modo que solo puede detectarse con la clave criptográfica adecuada. Esto permite evaluar la probabilidad de que un texto haya sido creado por Claude sin modificar el contenido visible. Esta implementación responde al Código de Prácticas sobre Transparencia de Contenido Generado por IA, suscrito por más de 190 organizaciones, incluidas OpenAI, Meta y Microsoft, y se alinea con los requisitos establecidos por la Ley de IA en la Unión Europea.
Los modelos de lenguaje como Claude generan texto palabra por palabra, y en situaciones donde hay múltiples opciones válidas, su selección se basa en procesos aleatorios. Sin embargo, la integración de la marca de agua depende de una clave y de las palabras previas, lo cual hace que la secuencia generada sea reconocible para quienes tengan acceso a dicha clave. Este método se basa en la tecnología SynthID-Text de Google DeepMind.
Es importante mencionar que esta marca no es texto oculto ni caracteres invisibles, y no tiene similitudes con marcas de agua visibles. Los usuarios no pueden diferenciar, a simple vista, un texto marcado de uno no marcado. Además, la implementación no afecta el costo ni la latencia del proceso de generación, ya que no se generan tokens adicionales. La empresa también subraya que esta marca no identifica al usuario o a la organización que generó el contenido.
Para los usuarios de Claude, esta novedad es prácticamente imperceptible, ya que no cambia la calidad ni la creatividad del texto producido. Anthropic sostiene que, en pruebas internas, no encontraron diferencias significativas en las valoraciones entre textos marcados y no marcados. Próximamente, la empresa planea lanzar una API para la detección de esta marca de agua, que actualmente se encuentra en desarrollo.
Sin embargo, es crucial señalar que la presencia o ausencia de la marca de agua no asegura de manera concluyente la autoría del texto. Aunque sugiere la probabilidad de que Claude haya intervenido, no distingue entre escritura original y ediciones menores. Esta marca de agua tiende a ser menos efectiva en textos breves, muy factuales o en códigos, donde hay menos elementos para que funcione, y es posible eliminarla reescribiendo el texto completo.
