去年八月,一名计划乘坐邮轮的男子在谷歌上搜索了皇家加勒比邮轮公司的客户服务电话号码。谷歌的人工智能概览功能在搜索结果顶部向他提供了一个电话号码。他拨打了该号码,提供了自己的银行卡详细信息,但该号码实际上属于诈骗分子。类似的案例也出现在西南航空的搜索结果中。这种变体攻击——即在人工智能摘要可能抓取的位置植入虚假的支持电话号码——获得了大量报道。
上周,日本警视厅宣布了一种更为隐蔽的变体攻击方式。我认为这种方式值得开发人员给予更多关注,因为其攻击面位于合法网站上:搜索框。很可能也包括你网站上的搜索框。
警方描述了如下场景:有人在社交媒体上被邀请加入一个投资群组。在汇款之前,此人采取了谨慎的做法,搜索了该群组的名称。搜索结果显示“XX 不是骗局”以及“我通过 XX 赚了钱”。页面顶部的人工智能摘要也附和道:“XX 不是骗局。”于是,此人放心地转出了资金。
受害者的验证习惯——“在信任之前先搜索一下”——已被融入陷阱之中。
当我阅读这份报告时,我的第一个问题是:这是如何做到的?我日常工作专注于 LLMO(优化网站以便被人工智能搜索引擎引用),因此我怀疑这涉及搜索引擎优化圈子中流传的某种搜索污染技术。然而,追踪结果显示,其手段比我预期的更加陈旧和简单:站点搜索垃圾信息,日本搜索引擎优化公司 JADE 早在 2023 年 2 月就已对此进行了记录。
本文将介绍其机制、人工智能摘要为何会重复谎言,以及你可以本周就部署的防御措施(noindex 指令、X-Robots-Tag 头部字段、无结果时返回 404 状态码)。
机制:三个步骤,无需黑客攻击
大多数带有搜索框的网站会在类似 /search?q=keyword 的网址上返回结果。典型实现中的两个特性为这种攻击创造了条件:
- 任何人都可以在查询参数中输入任意字符串
- 页面会将该查询反映在其
<title>或<h1>标签中(例如“'关键词' 的搜索结果 | Acme 公司”)
攻击过程如下:
- 攻击者在受信任的域名上构建一个搜索网址:
acme.com/search?q=XX+不是+骗局。无需触碰搜索框,仅凭网址即可完成操作。 - 他们从自己控制的网站链接到该网址。
- 谷歌爬虫跟随链接,抓取结果页面并将其编入索引。此后,网络搜索可能在合法域名下显示“XX 不是骗局 | Acme 公司”。
受害网站从未遭到入侵。没有恶意软件,没有非法闯入,也没有使用特殊工具。攻击者只是构建了一个网址并放置了一个链接。当我初次理解这一点时,我大声说道:“等等,就这样?”被利用的并非漏洞,而是规范本身。
对于搜索者而言,这看起来像是 Acme 公司的网站声称“不是骗局”。该域名多年来建立的信任被转租给了陌生人的语句。
为何人工智能摘要会重复谎言
人工智能概览及类似功能在结构上与检索增强生成(RAG)非常接近:从搜索索引中检索与查询相关的页面,然后从中合成答案。虽然内部机制未公开,但其依赖关系是可观察的:摘要是基于索引下游构建的。
人工智能无法察觉这种布局。就其所能判断的范围而言,它检索到的是受信任域名上的文本。它不会验证声明的真实性;而是权衡来源的权威性以及跨来源的一致性。因此,如果攻击者在几个信誉良好的域名的搜索网址中植入相同的句子,人工智能就会看到多个独立的权威来源达成一致。
这就是糟糕之处:人工智能越重视权威性信号,这种攻击对其效果就越好。那些勤勉严谨的人工智能系统反而最容易成为目标。
流程很简单:上游是搜索索引,下游是人工智能摘要
免责声明:本文内容来自互联网,该文观点不代表本站观点。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容,请到页面底部单击反馈,一经查实,本站将立刻删除。