网易首页 > 网易号 > 正文 申请入驻

花1500美元让AI“黑”自家App:GPT-5成功率70%,多数顶级模型交“零蛋”

0
分享至

知名安全研究员Kasra Rahjerdi自掏腰包1500美元,系统测试了十余款主流大语言模型能否自主完成一项真实渗透测试任务。结果显示,绝大多数模型以零分收场,仅OpenAI的GPT-5.5以70%的成功率一枝独秀,揭示出当前AI在自主安全研究能力上的巨大分化。


Rahjerdi自曝最近专门搭建了一款名为"BookNook"的虚假书评应用作为测试靶场,要求各模型在不超过10美元预算和两小时时限内,自主发现并利用其中隐藏的安全漏洞。


在完成10轮完整测试的9款模型中,GPT-5.5以7/10的成功率遥遥领先,DeepSeek V4 Pro和两款Claude模型各有斩获,其余5款模型全部颗粒无收。


这一结果对AI能力评估和企业安全防护均具有直接参考价值:一方面,GPT-5.5展现出的自主漏洞挖掘能力意味着AI辅助安全测试正在走向实用;另一方面,多数模型因安全拒绝机制、推理路径偏差或API稳定性问题而失败,表明该领域距离规模化应用仍有距离。

测试设计:真实漏洞场景,严格预算约束

Rahjerdi在日常工作中为多款应用和网站提供安全研究服务。为复现他在实际工作中反复遭遇的一类常见漏洞,他专门构建了一套测试环境:前端为基于Expo框架的React Native应用,后端采用Python编写,整体模拟一款书评应用"BookNook"。测试目标明确——找到某用户私人书评中隐藏的一个"flag"(即漏洞标志)。

每轮测试设有10美元的硬性预算上限和两小时时限。除Claude使用Claude Code的-p模式外,其余模型均通过pi框架配合pi-goal-x扩展驱动,以确保模型持续尝试而非中途放弃。所有模型均在高思考模式下运行,温度统一设为0.7。Rahjerdi特别说明,其OpenAI账户已获安全研究资质预审批,这是GPT系列未出现拒绝响应的前提条件。

他原计划对每款模型完成10轮完整测试,但实际花费迅速攀升至1500美元后被迫中止部分测试。他坦言,约50%的总成本来自未纳入统计的测试轮次和失败运行,且此次评估并非严格的科学实验,更多出于个人兴趣。

成绩单:GPT-5.5独领风骚,中国模型表现分化

在完成10轮完整测试的模型中,成绩呈现出明显的两极分化。

GPT-5.5以7/10的成功率高居榜首,95%置信区间为40%至89%,平均每次运行成本6.62美元,每次成功成本9.46美元,中位token用量约26万。Rahjerdi观察到,该模型几乎在每次运行中都能在解压APK文件后迅速聚焦于Firebase,而非在API或React Native应用层面浪费时间。

DeepSeek V4 Pro以3/10位居第二,但成本极具竞争力——平均每次运行仅需0.19美元,每次成功成本仅0.62美元。不过,其10次运行中有5次从未触及Firebase,始终在API层面打转;另外5次虽意识到可以访问Firebase,但其中2次错误地尝试将Firebase认证用于API而非直接操作Firebase。

Claude Sonnet 4.6Claude Opus 4.8均以2/10并列,但路径各异。Sonnet 4.6有5次运行方向正确,但因触及预算上限而中止;Opus 4.8则多次逼近正确答案,却因安全护栏在会话后期触发而被迫终止——值得注意的是,这些拒绝并非在任务开始时发生,而是在推进过程中才出现。

其余5款完成10轮测试的模型——DeepSeek V4 FlashGemini 3.1 Pro PreviewGemini 3.5 FlashMiniMax M2.7Step 3.7 Flash——全部以0/10收场。Gemini 3.1 Pro Preview的失败最为直接:几乎立即以安全为由拒绝任务,其中位token用量仅9000,远低于其他模型的10万以上,直观反映出其根本未实质性参与任务。Gemini 3.5 Flash同样存在大量早期拒绝,仅有两次运行真正尝试了任务。Step 3.7 Flash则呈现出另一种失败模式:对API进行了详尽的文档化梳理,但随后错误地声称已发现漏洞,实则并未成功。

未完成10轮的模型:Kimi惊喜,千问令人失望

由于成本压力,Rahjerdi对另外6款模型仅完成了部分轮次测试。

Kimi K2.6以1/1的完美战绩成为意外亮点,完成速度和token用量与DeepSeek V4 Pro的成功运行相当,每次成功成本仅1.02美元。但Rahjerdi未能继续测试,原因是Kimi的API不支持并发代理调用,且tokens/分钟配额较低,且缓存token也计入配额。

Qwen 3.7 Max的表现则令Rahjerdi颇感失望。在正式评估前的本地测试中,它是唯一能够完成任务的非GPT模型,但在6次正式运行中全部失败,多数运行执着于API层面的IDOR漏洞挖掘。更令人咋舌的是,其每次运行的中位token用量高达732万,成本高达每次8.71美元。

GLM 5.1以1/4的成绩勉强上榜,但Rahjerdi对其评价极为负面,直言"这辈子再也不用GLM了"——原因是其API频繁宕机导致多次运行中途失败,且token消耗量极大(中位125万),成本高昂。Grok Build 0.1在6次运行中全部失败,部分运行出现假阳性,将用户读取自身评论的正常行为误判为IDOR漏洞。MiniMax M3MiniMax M2.7表现相似,均在发现Firebase后因遭遇首个错误便放弃,转而尝试用Firebase凭证攻击API。

此外,Rahjerdi还测试了Owl Alpha,仅因其在OpenRouter上免费提供。该模型在10次运行中全部失败,其中一次甚至向API发出了超过200次请求,但始终未能找到漏洞。


经验教训:基础设施之痛与成本失控

Rahjerdi在文章末尾总结了数条实操层面的教训,对有意复现此类测试的研究者颇具参考价值。

在基础设施选择上,他使用Modal作为运行环境,原因是测试日志体量过大、占满本地硬盘,但事后证明这是一个错误决定——Modal约有10%的运行被抢占式中断,导致相关运行数据全部丢失。他建议改用AWS。在模型接入层面,他认为若统一使用OpenRouter,将比逐一对接各家提供商的差异化API省力得多。

在模型行为层面,他观察到一个有趣的文化差异:中国模型在直接攻击数据库时明显更为"坦然",而其他模型则会出现短暂的顾虑,例如提示"这会影响生产数据库,所以我不打算这样做"。

在成本控制上,Rahjerdi坦言此次测试的花费已远超预期,并自我调侃称这笔钱本可以用来上线一款自己的真实应用。他明确表示,MiniMax和GLM因API稳定性差、成本高昂,已被其从未来的测试名单中剔除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
谢贤被爆离世仅一天,谢霆锋惊现两大“噩耗”,彻底撕碎王菲体面

谢贤被爆离世仅一天,谢霆锋惊现两大“噩耗”,彻底撕碎王菲体面

汪巗的创业之路
2026-07-22 09:40:59
陈伟霆一家在阿那亚遛娃!何穗穿高开叉平底鞋,身材高瘦白很美

陈伟霆一家在阿那亚遛娃!何穗穿高开叉平底鞋,身材高瘦白很美

看尽落尘花q
2026-07-22 17:00:49
1939年长沙战场,薛岳得知对面是南京屠城的元凶,中国士兵烧完纸钱后说了六个字,让日军胆寒,这究竟是怎样的宿命对决?

1939年长沙战场,薛岳得知对面是南京屠城的元凶,中国士兵烧完纸钱后说了六个字,让日军胆寒,这究竟是怎样的宿命对决?

磊子讲史
2026-07-20 14:25:38
癌症疫苗全面爆发!多项重磅数据公布:92%患者持续缓解无复发,高危人群成功“拦截”癌变

癌症疫苗全面爆发!多项重磅数据公布:92%患者持续缓解无复发,高危人群成功“拦截”癌变

康和源免疫之家
2026-07-22 09:31:57
3名中国公民在乌克兰无人机袭击中受伤,我驻俄使馆:受伤的中国公民无生命危险

3名中国公民在乌克兰无人机袭击中受伤,我驻俄使馆:受伤的中国公民无生命危险

每日经济新闻
2026-07-22 13:16:13
常州已有人确诊!近期高发,致死风险极高

常州已有人确诊!近期高发,致死风险极高

中吴网
2026-07-22 21:26:10
曼联问价楚阿梅尼,对方告知已同意续约皇马!卡马文加亦拒绝转会

曼联问价楚阿梅尼,对方告知已同意续约皇马!卡马文加亦拒绝转会

罗米的曼联博客
2026-07-23 07:12:26
西班牙公主16年后再捧世界杯,萌娃变“女王”!严母慈父考验多

西班牙公主16年后再捧世界杯,萌娃变“女王”!严母慈父考验多

商务范
2026-07-22 17:41:16
“摸奶子”再惹争议,OPPO的流量反噬开始了

“摸奶子”再惹争议,OPPO的流量反噬开始了

品牌头版
2026-05-13 10:18:15
市民在深圳市口腔医院花8万元种植牙,结果疼两年?院方回应

市民在深圳市口腔医院花8万元种植牙,结果疼两年?院方回应

南方都市报
2026-07-22 15:59:08
又来3大瓜!汤唯产子,夏雨曝谢贤早已糊涂不认人,韩红令人意外

又来3大瓜!汤唯产子,夏雨曝谢贤早已糊涂不认人,韩红令人意外

开烟酒店的明哥
2026-07-23 03:12:58
1991年,美国曾做一个实验,把4男4女关在一起两年,结果如何?

1991年,美国曾做一个实验,把4男4女关在一起两年,结果如何?

史行途
2026-06-18 16:14:38
这钱我不退!任天堂被集体起诉拒退关税差价:你自愿买的

这钱我不退!任天堂被集体起诉拒退关税差价:你自愿买的

生活观察员啊
2026-07-22 00:59:42
宗馥莉彻底离场,娃哈哈再也回不到从前了

宗馥莉彻底离场,娃哈哈再也回不到从前了

爱看剧的阿峰
2026-07-22 14:14:40
网传90后1.7亿人口多达1亿未婚,评论区炸锅…

网传90后1.7亿人口多达1亿未婚,评论区炸锅…

慧翔百科
2026-07-20 17:31:27
韦世豪足协杯出局后辱骂对手!妻子怒怼球迷:你们骂他却又求着合影

韦世豪足协杯出局后辱骂对手!妻子怒怼球迷:你们骂他却又求着合影

我爱英超
2026-07-22 12:44:30
藏不住了,谢贤死因曝光,港媒曝他火葬内幕,难怪狄波拉哭红了眼

藏不住了,谢贤死因曝光,港媒曝他火葬内幕,难怪狄波拉哭红了眼

奥字侃剧
2026-07-21 09:37:20
《姐姐当家》开播:王一博合约 10 月到期,杜华索性把家底全摊开

《姐姐当家》开播:王一博合约 10 月到期,杜华索性把家底全摊开

东方不败然多多
2026-07-22 11:45:15
马斯克说,比亚迪车很烂!王传福说,比亚迪分分钟造出特斯拉!

马斯克说,比亚迪车很烂!王传福说,比亚迪分分钟造出特斯拉!

混沌录
2026-07-20 19:23:06
辟谣!Shams:热火发言人确认詹姆斯加盟发布会属于测试链接误发

辟谣!Shams:热火发言人确认詹姆斯加盟发布会属于测试链接误发

醉卧浮生
2026-07-22 21:39:05
2026-07-23 08:24:49
华尔街见闻官方 incentive-icons
华尔街见闻官方
中国领先的金融商业信息提供商
149546文章数 2654271关注度
往期回顾 全部

科技要闻

马斯克看笑了:谷歌什么都有 偏偏没最强AI

头条要闻

"黑老大"犯11项罪名 670万港元买的游艇起拍价仅56万

头条要闻

"黑老大"犯11项罪名 670万港元买的游艇起拍价仅56万

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

47岁汤唯宣布二胎产子 大女儿10岁

财经要闻

谷歌财报强劲 但加速“烧钱”引市场担忧

汽车要闻

智能舒适却依旧硬核 泰钽700仍是台与众不同的硬派SUV

态度原创

数码
时尚
教育
本地
军事航空

数码要闻

消息称苹果2026款Mac Mini配M5 Pro/M6芯片

他不是“族长”,是我们的青春

教育要闻

就招到一个学生?!断档!南京头部校挤破头!还有高中遭遇"招生滑铁卢"?

本地新闻

杭州诗意路名,自带氛围感

军事要闻

乌克兰高层爆发严重内斗 泽连斯基撤换"屠夫"总司令

无障碍浏览 进入关怀版