Anthropic悄悄为Claude AI输出添加水印,开发者已开始尝试破解

ceshi阅读:2026-08-14 08:21:11

Anthropic为Claude模型文本嵌入隐形水印

Anthropic已开始在其**Claude模型生成的所有文本中嵌入不可见的水印。该变更于2026年8月2日对欧盟地区推出的模型生效,Anthropic表示将逐步推广至全球范围。

在签署欧盟《人工智能法案》透明度行为准则后,Anthropic通过一篇支持文章阐述了这一计划。换言之,这并非**自愿行为。该水印覆盖Claude的所有输出渠道,包括聊天机器人、API、Claude Code以及AWS、Google Cloud和Microsoft Foundry等云合作伙伴平台。

Anthropic表示:“当受支持的Claude模型生成文本时,它会将不可见的水印直接编织到文本本身中。你看不到它,它也不会改变Claude回复的含义、质量或可读性。由于水印是文本的一部分,当文本被复制粘贴到其他地方时,水印会随之移动,并且可能通过某些编辑操作后依然保留。”

因此,这比用户通常认为的简单方法要复杂一些。当受支持的Claude模型撰写文本时,它会将不可见的水印直接嵌入单词中,没有**可见标记。由于水印是文本的一部分,它能在复制粘贴后幸存,Anthropic承认,“可能通过某些编辑操作后依然保留。”文件则额外增加一层保护:基于C2PA开放标准的签名元数据(可以理解为一种数字货运清单,记录文件由谁生成以及后续是否被修改过)。

Anthropic尚未说明水印的具体生成方式。支持文章称其为模型级(模型在训练时已集成)和文本原生(并非元数据生成器等外部工具),但检测文档和具体技术细节尚未公布。

研究人员推测这是一种统计特征:模型将其词汇选择偏向于一种微弱的、可检测的偏差,这与Google在SynthID Text中使用的方法属于同一类。在Anthropic发布检测器之前,这仍只是猜测。

但这并未阻止隐私爱好者的反对,一些专家已经开始研究破解Anthropic秘密水印的方法。例如,项目mikiane/claude-watermark-cleaner会**不可见的Unicode字符,然后使用非Claude模型重写文本,以扰乱令牌模式。

另一个大型项目guillaumemeyer/watermarks-remover则能去除Claude文本水印,以及C2PA和SynthID类信号,覆盖PNG、JPEG、SVG、PDF和DOCX格式。作者认为,统计文本水印“不是一种可靠的溯源方式”,主要只会迫使用户额外花费一次模型调用来清洗自己的写作内容。在Anthropic发布其检测器和阈值之前,无法保证**去除方法有效。

Anthropic自身的历史让隐私反应更加尖锐。该公司在3月移除了一个隐藏的Claude Code追踪器,此前研究人员发现它通过未公开的Unicode标记标记了部分用户的位置和代理使用情况——这正是当前水印计划所采用的核心隐蔽标记技术。

水印只能证明Claude参与了文本的生成,而非**由它撰写,因此它会对经过少量编辑的原创文本与**由AI生成的文本一视同仁。如果你让Claude校对或翻译你的段落,输出结果仍可能携带该信号。Anthropic明确表示,大量编辑可能会去除水印,但缺失水印并不证明文本由人类撰写。

美国的一项法案《COPIED法案》也推动同样的理念:建立一种标准化的AI内容水印方式,以便平台追溯其来源。正如Claude的敲诈问题所表明的那样,该公司的模型已因其处理的文本内容而受到严密审查。

Anthropic尚未公布何时发布检测工具,以便**人验证水印的存在。

本文地址:https://licai.bestwheel.com.cn/qk/709966.html

文章标题:Anthropic悄悄为Claude AI输出添加水印,开发者已开始尝试破解

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。