上周,Anthropic 宣布将为 Claude 生成的文本加入一种“隐形水印”,周末它终于补上了技术细节。
跟先前猜测的差不多,Claude 的文本水印将采用 Google DeepMind 开发的SynthID。答案也比“往文字里塞几个特殊字符”更复杂,水印并不是写完以后再盖上去的,而是在 Claude 写下每一个 token的过程中,被一点点“写”进文字里。
同一时间,反检测的工具已经出现。GitHub 上开始有人制作专门针对文本水印的移除工具。
这的确不是一个抵抗力很强的技术,用大白话说,“拿其它模型洗一洗”,就能破坏隐形水印的效力。
这让 Claude 的水印一时间变得很尴尬,而且,细思极恐:Claude为了让一段文字以后能够被认出来,需要改变词语被选中的概率;而想让它不被认出来的人,最自然的反击方式之一恰恰就是,重新改写这些词。
Claude 的水印,不是“藏”进去的,而是“写”进去的
理解这场攻防,首先得知道,早就已经出现的 SynthID 到底在做什么。
大语言模型生成文字时,并不是先在脑子里想好一个完整句子,再逐字输出。每一步,它都会根据已经出现的上下文,为下一个可能出现的 token计算一组概率,然后从中完成一次选择。
0
评论 (0)