![]()
这项由北京大学、2077AI公司与香港科技大学联合开展的研究,以预印本形式于2026年8月4日发布在arXiv平台,编号为arXiv:2608.04244。研究围绕多模态大语言模型(也就是那些既能"看图"又能"读字"的AI)展开,核心问题是:当一张图片里的文字和视觉画面互相"说谎"时,AI究竟会相信哪一个?
假设你站在一条典型的美国郊区街道上,四周是低矮的独栋住宅、宽阔的草坪和靠右行驶的车辆。一切视觉信号都在说"这里是美国"。但街角立着一块牌子,上面写着"Welkom to Holland"。如果此刻你闭上眼睛,只看这块牌子,你或许会以为自己身处荷兰。AI也会犯同样的错误吗?
这正是这项研究试图搞清楚的事情。研究团队构建了一个名为SIGNPOST-Bench的测试集,专门用来衡量AI在"文字"与"画面"发生冲突时的表现。测试结果相当惊人:面对故意植入错误地名的图片,AI的定位误差从原来的282公里急剧飙升到1347公里,扩大了将近5倍。换句话说,一块假路牌,就能让AI以为你从密歇根州跑到了大西洋对岸。
一、为什么AI会同时"看图"和"读字",这有什么问题?
现代的多模态AI就像一个受过严格训练的地理侦探。当你把一张街景照片递给它,它会同时观察建筑风格、植被、路牌字体、行车方向、天空颜色,以及图片里出现的任何文字——商店招牌、路名、广告牌、门牌号……这些线索共同构成了它对"这里是哪儿"的判断。
绝大多数时候,这两种信息渠道是和谐一致的。一张拍摄于北京胡同的照片,既有青砖灰瓦的视觉特征,又有中文汉字的文字特征,两者一致,AI自然能轻松判断。但现实世界中,这两种信号并不总是一致的。荷兰小镇的咖啡馆可能挂着英文招牌;美国有一个城市就叫"Holland"(荷兰市);全球各地都有以外国地名命名的地方——"New York"可以是美国纽约,也可以是某个农场的名字。
过去的AI测试大多只关心最终答案对不对,却很少追问:AI到底是靠"看"得出这个答案,还是靠"读"得出的?当两者发生矛盾时,AI会做什么?这个问题,在以前的研究里基本上是一片空白。
更麻烦的是,AI在处理冲突时的表现,跟它在正常情况下的表现几乎没有关联。也就是说,一个平时定位很准的AI,不一定在遇到假路牌时能保持清醒;而一个平时定位一般的AI,在某些情况下反而可能更能识破干扰。这就好比一个平时成绩优秀的学生,未必比普通学生更能抵抗作弊的诱惑。
正因如此,研究团队决定专门设计一套测试框架,让这个问题从"隐形"变成"可测量"。
二、这套测试框架是怎么搭建的?五张照片讲述一个完整故事
研究团队的核心思路,可以用"五胞胎照片"来理解。
对于每一张原始街景照片,研究团队会制作四张改动版,与原版合计形成一个"五元组"。这五张照片除了图中的文字内容不同,其他所有视觉元素——建筑、植被、路面、天空——都保持完全一致。这样一来,研究人员就能精确地把"文字变化"单独抽出来,衡量它对AI判断的影响,排除其他因素的干扰。
原版照片保持完整不变,作为基准参考。第一种改动叫做"空白版"——把图中选定的文字区域直接抹掉,什么都不填。这个版本的作用是测量"没有文字时AI的定位能力",相当于蒙住了AI的阅读能力,只让它靠视觉推断。第二种改动叫做"相似版"——用与原文地理含义相近、不引起混淆的文字替换原文。比如,如果原版写着"Holland",相似版可能换成"Flanders"(佛兰德斯,同样是欧洲地名,文化背景类似)。这个版本测试的是"兼容性文字的影响"。第三种改动叫做"随机版"——用与当前地点毫无关系的文字替换原文,比如换成另一种语言的随机词汇,或者毫不相关的店名。这个版本测试的是"不相关文字是否会干扰AI"。第四种改动是最关键的"对抗版"——用一个来自截然不同大洲的真实地名替换原文,刻意与图片的真实地点相冲突。比如,一张拍摄于美国弗吉尼亚州的图片,对抗版里的文字可能换成"悉尼搬家公司"和"塔塔汽车"(印度品牌)。这个版本测试的是"故意误导性文字能把AI骗到多远的地方"。
这套设计的精妙之处在于,它把文字的"兼容程度"拆解成了四个清晰的层次:原生文字、无文字、兼容文字、无关文字、冲突文字。通过对比这五种条件下AI的预测结果,研究人员既能测量AI被误导的程度,还能测量AI是否真的朝着那个虚假地名的方向跑偏了,而不只是随机乱猜。
三、这套测试集从哪里来,规模有多大?
为了确保测试结论的可靠性,研究团队从四个不同来源收集了原始图片。IM2GPS3K是一个经典的地理定位测试集,来自各种地理标注的网络照片,视角多样。YFCC4K同样来自网络,从一个拥有一亿张照片的大型数据集中随机采样。GoogleSV来自谷歌街景,覆盖全球多个国家,按国家比例采样,确保地理多样性。BaiduSV来自百度街景,专门覆盖中国各省市,弥补了前几个来源在中国地区的不足。
从将近90万张原始照片出发,研究团队首先用OCR(光学字符识别)技术筛选出包含清晰可辨、可编辑文字的图片,最终保留了5478张有效图片。随后,借助谷歌旗下的一个AI语言模型,对每张图片自动生成三种替换文字(相似版、随机版、对抗版),并用图像编辑模型将替换后的文字精确地"写"回图片中,同时尽量不破坏文字周围的场景。
经过质量审核,最终保留了5111组有效的"五元组",对应25555张图片和10084个文字编辑区域。两位人工标注员还专门审查了其中350张图片的文字类型分类,达到83.4%的一致率,验证了分类系统的可靠性。另一组审核员对120张编辑后图片的质量打分,结果显示文字渲染自然度平均得分4.0(满分5分),背景破坏程度平均仅1.14(接近无损),87.5%的图片中替换文字完全清晰可读。
四、文字的"地理含量"高低,会影响AI被骗的程度吗?
研究团队还设计了一套文字分类系统,把图片中的文字按照"地理识别价值"分成三个等级。
第一类叫"便携型"文字,指那些到处都能见到、本身不能确定地点的文字,比如全球通用的品牌名(可口可乐、麦当劳)或者通用警示语("禁止吸烟")。这类文字即使换成别的内容,对地理判断的影响也相对有限。第二类叫"文化型"文字,指能把地点范围缩小到某个语言圈或文化区域、但不能精确定位的文字,比如日文假名、阿拉伯文招牌、中文汉字。这类文字能告诉AI"这大概在东亚"或"这大概在中东",但无法确定具体城市。第三类叫"地理精确型"文字,指直接点名了具体地点的文字,包括街道名称、邮政编码、地区名、门牌地址,以及具有独特地域识别性的本地品牌名。
测试结果显示,地理精确型文字在原版图片中帮助AI定位最准确,原版平均得分高达59.65分(满分100分,以距离精度计算)。但正因为AI对这类文字依赖度最高,一旦这类文字被替换成错误信息,AI受到的冲击也最大——得分暴跌25.14分,相对下降幅度高达42.2%。相比之下,便携型文字被替换后得分仅下降11.31分,跌幅约25%。文化型文字居中,下降17.23分,跌幅约36%。
这个规律有点像一个经验丰富的向导:越是依赖路牌来辨认方向的人,一旦路牌被人调换,迷路的程度就越深;而那些靠太阳位置和地形轮廓判断方向的人,即使路牌出了问题,也不至于走得太偏。
五、测试了哪二十个AI,结果怎么样?
研究团队选取了来自七家公司的20个主流多模态AI进行测试,覆盖谷歌(Gemini系列,4个)、OpenAI(GPT系列,4个)、Anthropic(Claude系列,3个)、阿里巴巴(Qwen3-VL系列,3个)、月之暗面(Moonshot系列,3个)、字节跳动(Seed系列,2个)和xAI(Grok-4,1个)。
每个AI都要对全部5111个五元组的每一张照片都给出坐标预测,合计完成51.1万次预测任务。评测采用统一的提示词,只要求AI直接给出经纬度坐标,不附带思维链推理过程。
为了综合评价每个AI的表现,研究团队设计了三个核心指标。第一个指标叫"加权定位精度"(WLA),通过指数衰减公式把距离误差转化成一个0到100之间的分数,距离越近分数越高——预测位置与真实位置相差138公里时得50分,相差1000公里时接近0分。第二个指标叫"文字偏差分数"(TBS),专门衡量替换文字之后预测误差的变化量——正值意味着替换文字让AI变得更不准,负值意味着替换文字让AI反而变准了。这个指标以"空白版"作为基准,排除了视觉信息本身的干扰,专门测量文字内容的净影响。第三个指标叫"陷阱命中率"(TFR),专门针对对抗版图片,统计AI的预测坐标落在注入地名的真实位置50公里范围内的比例——这个数字越高,说明AI越容易被假路牌"骗"到那个错误的目的地。
在综合排名中,谷歌的Gemini-3-Flash和Gemini-3.1-Pro位居前两位,综合得分分别是72.70和72.23。Claude-Haiku-4.5垫底,得分仅38.87。然而,没有任何一个AI对冲突文字完全免疫。
六、具体数字说明了什么?假路牌的威力到底有多大?
来看几个关键数据点,它们能更直观地说明问题的严重性。
在正常图片(原版)条件下,20个AI的平均定位精度(WLA)是47.11分。面对对抗版图片,这个数字跌至29.89分,相对下降幅度高达36.6%。中位数误差从282公里跳到1347公里,涨了将近5倍。预测误差超过2500公里(相当于从北京到欧洲的距离)的比例,从11.7%暴增到31.7%。换句话说,在正常情况下,每10次预测中只有1次出现这种级别的大偏差;但遭遇假路牌后,几乎每3次就有1次出现如此严重的误判。
陷阱命中率方面,在所有能被地图坐标化的1732个对抗样本中(占总量约33.9%),不同AI的命中率在6.5%到20.1%之间。谷歌的三款Gemini模型命中率相对最低(6.5%到10%),而Claude-Haiku-4.5的命中率最高,高达20.1%。这意味着每5张带有假路牌的图片,就有1张成功把Claude-Haiku-4.5的预测"钓"到了假路牌指向的错误地点附近50公里内。
研究团队还专门验证了一个问题:AI的预测是真的朝着假路牌指向的地方偏移,还是只是随机漂离了正确答案?他们用"陷阱距离减少量"(TDR)这个指标来衡量——对于每张对抗版图片,计算"空白版预测距离假地名有多远"减去"对抗版预测距离假地名有多远"。如果这个差值是正数,说明对抗版让AI的预测更靠近了假地名,也就是说文字真的在"拉"着AI向那个方向走。结果显示,20个AI无一例外,平均陷阱距离减少量均为正值,范围从343公里到1926公里不等。这清楚地说明,假路牌不仅让AI变得更不准,还在积极地把AI"拽"向那个错误的目的地。
七、相似、随机、冲突三种文字,各自产生了什么不同的效果?
这是这项研究中最细腻的一个发现层面。
对于兼容性文字(相似版),平均效果是让定位误差减少379公里。换句话说,用一个与原文化背景相近的替换词,不仅不会干扰AI,还略微帮助了AI,这可能是因为替换文字提供了与场景一致的额外语义线索。在所有数据集中,相似版的平均得分都高于对应的空白版,说明这个现象是稳定的。
对于无关文字(随机版),平均效果是让定位误差增加959公里。随机版的文字虽然没有指向特定错误地点,但它引入了与场景毫不相干的语义噪音,让AI感到困惑,从而降低了定位准确性。
对于冲突文字(对抗版),平均效果是让定位误差增加1577公里,远超随机版的干扰幅度。更重要的是,如前所述,这种增加并非随机的,而是有方向性的——指向假路牌上的那个地名。
还有一个有趣的现象值得特别说明:在原版图片表现相对较弱(得分低于45)的AI身上,相似版的得分有时甚至超过了原版。这说明,对于那些本来就不擅长从画面中提取地理信息的AI来说,一个与场景一致的文字线索反而能成为有效的"辅助"。AI对文字的依赖程度,在能力较弱的模型身上体现得更为明显。
八、能力强的AI就一定更能抵抗假路牌吗?
这是整个研究中最出人意料的一个结论:不一定。
研究团队把AI的评价分成两个独立维度——"能力分"(C)和"冲突抵抗分"(R)。能力分反映的是AI在正常情况下(原版和空白版)的定位准确度;冲突抵抗分反映的是AI在遭遇随机文字和冲突文字时的稳健程度,同时还要惩罚陷阱命中率高和误差增加量大的情况。两个分数综合后得到一个"多模态冲突抵抗综合评分"(MCRS)。
数据显示,能力分和冲突抵抗分并不总是同步的。阿里巴巴的Qwen3-VL-30B能力分仅36.55,在20个AI中排名靠后,但冲突抵抗分高达80.05,居所有模型第四位。字节跳动的Seed-2.0-Pro能力分55.01,相对较强,但冲突抵抗分只有71.21,排名落后于Qwen3-VL-30B。同样是阿里巴巴的模型,Qwen3-VL-235B(参数量是30B版本的近8倍)在原版图片上得分更高,但面对对抗版图片时的得分反而更低,说明参数规模大、模型更强,并不自动带来更强的抗干扰能力。
对这一现象,研究团队提出了一个可能的解释:大型语言模型在预训练时接触了海量文本,因此对知名地名形成了极为强烈的语义关联。当图片中出现"巴黎"这个词时,模型内部与"巴黎"相关的知识网络会被强烈激活,可能强烈到足以压过视觉信息传递的"这不像欧洲"的感受。能力越强的模型,有时反而对文字的"语义吸引力"越敏感,在文字与视觉冲突时,反而更容易被文字拉偏。
九、让AI知道"可能有假路牌",能帮助它做出更好的判断吗?
研究团队针对这个问题专门设计了一个小实验,选取了Gemini-2.5-Flash和GPT-4o-mini两个模型进行深入测试。
测试分为两种方式。第一种是"结构化探测":给AI一个复杂的分步提示词,要求它依次说明从视觉线索推断的地点、从文字线索推断的地点、两者是否一致、更信任哪一种,最后给出综合坐标。第二种是"防御提示":给AI一个更明确的指令,让它在发现视觉和文字冲突时,优先相信视觉,同时也报告是否发现了冲突。
结果很有启示性。在结构化探测条件下,Gemini-2.5-Flash的平均定位精度(WLA)是38.28,但"冲突检测准确率"(也就是它在对抗版图片中正确识别出文字与画面矛盾的比例)只有14.2%——换句话说,它大多数时候根本没有意识到自己被骗了。GPT-4o-mini的冲突检测准确率稍高,达32.8%,但代价是定位精度大幅下降,只有15.10。
切换到防御提示后,Gemini-2.5-Flash的冲突检测准确率大幅提升到49.0%,但定位精度没有明显改善。GPT-4o-mini则走了反方向——防御提示后冲突检测准确率从32.8%降到19.3%,同时定位精度略有提升到18.70。两个模型都没能同时在"识别冲突"和"维持定位精度"两个维度上取得改善,说明通过提示词来让AI识别并解决文字-视觉冲突,目前效果相当有限。
研究团队还让这两个模型完成了一些相关任务,比如判断一张图片中文字和场景是否一致,或者仅凭视觉判断这张图片拍摄于哪个国家。Gemini-2.5-Flash能够在35.2%的对抗样本中主动发现不一致,而GPT-4o-mini在只判断"文字和画面是否冲突"这个任务上,也只能识别13.9%。在"凭视觉判断国家"这个任务里,两个模型分别有37.7%和56.8%的概率选择了假路牌指向的错误国家,而非图片真实所在的国家。这说明,对文字的偏信并不只是定位任务的特有问题,而是这些AI在多种任务中都可能表现出的一种系统性倾向。
说到底,这项研究揭示的是AI感知世界方式中一个尚未被充分重视的薄弱环节。这些AI并不是单纯的"眼睛",也不是单纯的"读者",它们是同时依赖两种信道的感知系统。在正常情况下,这种双信道架构是优势;但当两个信道说的不一样时,AI缺乏一套可靠的"仲裁机制"来判断该听谁的。
对于普通人来说,这个研究提醒我们,AI驾驶、AI导航、AI安防、AI地理核查等应用场景里,凡是涉及"从真实场景中读取信息"的任务,都需要考虑这种文字-视觉冲突的风险。一张贴着虚假标签的路牌照片,可能足以让AI系统作出完全错误的判断。随着AI工具在现实世界中的应用越来越广泛,理解并修复这个盲点,将不只是学术问题,也是实际工程问题。
这项研究所涉及的模型已发展到2026年中期的版本,对那些已经习惯使用AI工具的读者来说,这个结论既是当下的警示,也是未来改进的起点。有兴趣深入研究的读者,可以通过arXiv编号2608.04244获取完整论文,同时研究团队也已在Hugging Face平台(数据集名称inorganicwriter/SIGNPOST-Bench)和GitHub公开了测试集元数据和评估代码,供研究者复现和拓展。
Q&A
Q1:SIGNPOST-Bench测试集是用什么方法生成假路牌图片的?
A:研究团队使用了阿里巴巴开源的Qwen-Image-Edit-2509图像编辑模型,通过ComfyUI框架对图片中选定的文字区域进行局部替换。首先由谷歌的Gemini-3.1-Flash-Lite语言模型生成三种替换文字(相似、随机、对抗),再由图像编辑模型将新文字精准渲染回原始位置,同时尽量保持周围场景不受破坏。最终生成图片的文字渲染自然度平均得分4.0/5,背景损伤极低。
Q2:多模态大模型面对假路牌时的定位误差为什么能扩大将近5倍?
A:核心原因在于这些AI在预训练时积累了大量文本知识,对地名形成了极强的语义关联。当图片中出现"巴黎"这个词时,模型内部与巴黎相关的知识会被强烈激活,足以压过视觉场景传递的"这里不像法国"的信号。AI对文字的语义识别速度和强度,有时会超过它对视觉环境的综合分析,从而导致预测被文字"拉走",朝假地名的真实坐标方向大幅偏移。
Q3:增加防御提示词是否能有效保护多模态AI不被假路牌误导?
A:目前效果十分有限。研究团队对Gemini-2.5-Flash和GPT-4o-mini的测试显示,加入冲突感知提示后,两个模型都无法同时提升"识别冲突的能力"和"保持定位准确度"——一个模型识别冲突的能力提高了,但定位精度没有改善;另一个模型在某些条件下连识别冲突的能力也有所下降。这说明仅靠改写提示词,并不能从根本上解决模型内部文字与视觉信息的权重失衡问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.