网易首页 > 网易号 > 正文 申请入驻

真钱买假模型?187篇论文被「套壳API」坑惨,准确率暴跌

0
分享至



编辑|Panda

近段时间,时不时就有用户抱怨如今的大模型 API 越来越像「薛定谔的猫」:有时候调用 GPT-5 显得极其聪明,有时候却像个智障。我们不禁怀疑大模型到底有没有在后台偷偷降智。

现在,一篇来自 CISPA 亥姆霍兹信息安全中心的最新论文《Real Money, Fake Models: Deceptive Model Claims in Shadow APIs》为我们揭开了一点谜底:那些你花真金白银购买的「第三方 API」,有可能偷偷把前沿大模型换成了廉价的替代品



蚂蚁集团工程师陈成的总结推文截图

该论文在社交网络上引发了广泛讨论:







来自 X 评论,Credit: @frxiaobei、@DeepSky0605、@AgiRay1015、@Tk206_



  • 论文标题:Real Money, Fake Models: Deceptive Model Claims in Shadow APIs
  • 论文地址:https://arxiv.org/abs/2603.01919

大模型 API 的灰色江湖

众所周知,受限于高昂的定价、支付壁垒以及特定区域的限制,直接访问 GPT-5 或 Gemini 2.5 等前沿大模型往往困难重重。这种限制催生了一个庞大的第三方代理服务市场。这些服务在学术界被称为「影子 API(Shadow API)」,它们声称可以通过间接访问,提供不受区域限制的官方模型服务。

在这个充满各种「镜像站」和「代理池」的灰色江湖中,大模型套壳现象早有先例。

回顾过去,无论是某斯坦福 AI 团队挪用清华系开源大模型 MiniCPM 的风波(参阅报道《斯坦福爆火 Llama3-V 竟抄袭国内开源项目,作者火速删库》),还是市面上各种打着 GPT-4 旗号实际却调用廉价小模型的山寨网站,都让开发者防不胜防。

针对这些 API 进行的系统性审计,彻底暴露了这一灰色产业链对严肃科学研究的破坏力。

CISPA 的研究人员详细追踪了17个影子 API 服务,发现它们已经被引用进了187篇学术论文中,并对一部分具有代表性的 API 进行了针对性审计。

这些论文里约有 62% 已经被 ACL 、 CVPR 和 ICLR 等顶级会议录用。其中最受欢迎的一个影子 API 已经积累了 5966 次论文引用,与其相关的一个 GitHub 项目更是获得了将近 6 万个星标。

深入调查这些服务的合规性时,情况更加令人担忧。在这 17 个服务中,多达 11 个是基于 OneAPI 或 NewAPI 等开源 API 分发系统搭建的。离谱的是,这 17 个提供商中只有一家拥有正规的 ICP 备案,其余绝大多数都是个人运营的黑盒,毫无透明度可言



Shadow API 在学术界使用情况

能力雪崩:当医学专家变成赤脚医生

科研结论如果建立在虚假的底层模型上,整个实验的地基就会随之坍塌。为了弄清楚这些影子 API 到底掺了多少水分,研究团队在科学推理领域(如 AIME 2025、GPQA )和极其敏感的高风险领域(如医疗 MedQA、法律 LegalBench)对具有代表性的API进行了多维度的基准测试。

测试结果令人触目惊心。

以高风险的医疗基准 MedQA 为例,官方的 Gemini-2.5-flash 模型准确率高达 83.82%。

当研究人员通过这些号称「完全一致」的影子 API 进行测试时,准确率直接断崖式下跌到了平均 36.95%。高达 47% 的性能缺口,意味着在一半以上的医疗诊断问题上,该模型可能给出致命的错误建议。

在法律基准测试 LegalBench 中,情况同样糟糕,所有接受评估的影子 API 表现均落后于官方端点 40.10% 到 42.73%。



影子 API 在医疗和法律领域性能下降

下表展示了两个示例:



高难度的逻辑推理任务往往是假模型的重灾区。在包含竞赛级数学题的 AIME 2025 测试中,某热门影子 API 遭遇了严重的精度滑铁卢,其提供的 Gemini-2.5-pro 准确率暴跌 40.00% ,而 DeepSeek-Reasoner 的准确率也急降了 38.89%。



影子 API 在数学和逻辑推理领域性能下降

除了智商大打折扣,它们的安全性也处于一种高度不可控的状态。在面临各种代码混淆或恶意提示词的越狱攻击测试中,影子 API 的表现毫无规律可言。它们有时会严重低估有害内容的风险,给出的有害性评分比官方模型低 0.23 ,有时又会把有害性放大近一倍。



影子 API 与官方 API 在 JailbreakBench 数据集上的安全性能比较

指纹识别 & 提供商的三种套路

为了拿到这些黑盒 API 造假的确凿证据,研究人员动用了大模型指纹识别框架 LLMmap以及模型相等性测试(MET)来直接验证模型的真实身份。LLMmap 能够通过分析模型对特定查询的响应,计算出输出结果与参考数据库之间的余弦距离,从而判断它到底是个什么模型。

在所有被评估的 24 个具体模型端点中,有 45.83% 的端点直接未能通过指纹验证,另外还有 12.50% 的端点表现出与官方模型存在巨大的余弦距离偏差。这两个数据加起来,意味着超过半数的服务在底层悄悄替换了模型



通过进一步对生成的 token 数量方差以及推理延迟时间进行分析,研究人员发现官方 API 总是呈现出稳定规律的延迟,而影子 API 的延迟经常出现剧烈的抖动,其波动率甚至会超过官方基准的 2 倍以上。

论文揭露了影子 API 供应商常见的三种经济欺骗手段:

  • 信息溢价: 收取高昂的旗舰版费用,却在后台用能力相似但更便宜的模型进行替换。例如某 API 标榜提供 Gemini 2.0 的早期版本,实际却以 7 倍以上的惊人差价提供 2.5 版本。
  • 折扣替换: 以官方原价收费,但把高端的闭源大模型替换成低成本的开源模型。比如用户高价点名要 GPT-5 ,指纹识别却无情地揭露后台默默运行的其实是 GLM-4-9B。
  • 加价倒卖: 在官方价格基础上加收服务费,同时依旧在后台替换底层模型以赚取多重差价。



三种经济欺骗机制

经过计算,虽然用户是按照官方标准费率(例如 1000 次请求约 14.84 美元)支付的费用,但实际上得到的有效 token 价值只有 5.70 美元到 7.77 美元。这种做法让供应商仅仅在少量查询中就能赚取过半的暴利利润。



科研大厦底层受创

如果普通开发者在构建娱乐机器人时买到了假模型,顶多是带来了糟糕的用户体验。一旦学术界大规模将这些掺水接口用于严肃的数据标注、算法评估或文献总结,整个 AI 研究大厦的公信力都会被严重动摇。

自 2025 年初 DeepSeek 等前沿大模型相继发布并迅速迭代以来,学术界对调用最新强大模型的需求与日俱增。由于正规渠道受限,大量亟待发表论文的研究人员被迫转向这些缺乏监管的影子 API 。

研究者进行了一个保守的估算,即便只有 30% 的受影响论文需要重新运行实验,仅为了修复这 187 篇已知论文中由模型替换带来的数据污染,就需要花费高达 11.5 万至 14 万美元的计算和人工成本。这笔账还没有算上那些引用了这些问题论文的 5966 项后续研究,这些后来者极可能已经在不知不觉中继承并放大了这些底层错误。



Shadow API 生产和交易的生动图解

论文作者给出的最终建议直白且强硬:应当完全避免在严肃的研究工作流中使用任何未经严格验证的影子 API

如果迫于客观条件不得不使用,研究团队在正式收集数据前,必须引入强制性的审核协议。这包括运行至少 24 次指纹探测、进行 500 个样本分布测试以比对 p 值,以及通过多次独立会话来检查延迟和方差是否异常

在这个真假难辨的 AI 时代,技术永远在狂飙突进,而商业的阴暗面也同样在疯狂滋长。对于每一位追求严谨的从业者和研究员来说,保持怀疑态度是我们面对黑盒大模型服务时的最后一道防线。

你被坑过吗?

https://x.com/chenchengpro/status/2029586877800686056

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
世界杯最失望11人阵容曝光:8队球员入围 英格兰2将 C罗庆幸落选

世界杯最失望11人阵容曝光:8队球员入围 英格兰2将 C罗庆幸落选

侃球熊弟
2026-07-21 23:23:37
中央安全生产考核巡查组第六组对上海市开展三季度安全生产明查暗访

中央安全生产考核巡查组第六组对上海市开展三季度安全生产明查暗访

澎湃新闻
2026-07-21 20:28:26
上海男篮续约外援遇阻,洛夫顿本人发声:他们不想让我回去!

上海男篮续约外援遇阻,洛夫顿本人发声:他们不想让我回去!

中国篮坛快讯
2026-07-22 15:28:22
专家再次预测中国房价走势,大概率又是对的,建议提前做好准备

专家再次预测中国房价走势,大概率又是对的,建议提前做好准备

阿离家居
2026-07-22 04:27:20
人伦大乱正在毁掉无数中国家庭:3种乱象就在日常,拖垮一家人

人伦大乱正在毁掉无数中国家庭:3种乱象就在日常,拖垮一家人

阿凯销售场
2026-07-04 15:35:28
三巨头来了!知情人爆料:詹姆斯已做出决定

三巨头来了!知情人爆料:詹姆斯已做出决定

篮球大视野
2026-07-22 15:28:02
1岁男童溺亡遗体找到!目击者发声,妈妈崩溃下跪,外公给一耳光

1岁男童溺亡遗体找到!目击者发声,妈妈崩溃下跪,外公给一耳光

勇敢的人享受生活
2026-07-22 06:30:44
女警官资助宁夏山村女孩三年学费,26年后,女孩定居深圳成为工程师,欲寻警官报恩,“我发生翻天覆地的变化,这都离不开她的帮助”

女警官资助宁夏山村女孩三年学费,26年后,女孩定居深圳成为工程师,欲寻警官报恩,“我发生翻天覆地的变化,这都离不开她的帮助”

蓬勃新闻
2026-07-21 16:05:31
李奇微晚年断言,全球仅两位将领善打硬仗,其余只会纸上谈兵

李奇微晚年断言,全球仅两位将领善打硬仗,其余只会纸上谈兵

唠叨说历史
2026-06-25 17:53:26
飞16小时来华吃披萨,首站就崩溃!西班牙博主:我这30年白活了

飞16小时来华吃披萨,首站就崩溃!西班牙博主:我这30年白活了

米果说识
2026-07-19 11:34:28
金巧巧直播喊话:“沈阳的那个谁,你欠我爸爸60万,赶紧还钱!”原来她的难,你想不到

金巧巧直播喊话:“沈阳的那个谁,你欠我爸爸60万,赶紧还钱!”原来她的难,你想不到

她时尚丫
2026-07-21 20:44:10
快讯!解放军用无人机在仁爱礁坐滩舰周围有了新发现!

快讯!解放军用无人机在仁爱礁坐滩舰周围有了新发现!

故事终将光明磊落
2026-07-22 17:05:13
女生高考684分,称花3000元咨询高考规划师,被录进“双非”:至今仍是全校录取最高分,原计划上央财或上财

女生高考684分,称花3000元咨询高考规划师,被录进“双非”:至今仍是全校录取最高分,原计划上央财或上财

大风新闻
2026-07-22 08:36:03
胡总编为何如此惶恐?

胡总编为何如此惶恐?

娱乐的硬糖吖
2026-07-22 06:12:41
毛岸英入朝作战牺牲,主要责任人是谁?毛主席其实早就点明过真相

毛岸英入朝作战牺牲,主要责任人是谁?毛主席其实早就点明过真相

何氽简史
2026-07-22 16:39:09
为啥邹市明比王宝强惨?原因很现实,冉莹颖比马蓉多了2个杀招

为啥邹市明比王宝强惨?原因很现实,冉莹颖比马蓉多了2个杀招

一盅情怀
2026-07-22 15:44:00
谢贤被爆离世仅一天,谢霆锋惊现两大“噩耗”,彻底撕碎王菲体面

谢贤被爆离世仅一天,谢霆锋惊现两大“噩耗”,彻底撕碎王菲体面

汪巗的创业之路
2026-07-22 09:40:59
悲哀!外甥考上西南交大,男子特意送上1688元升学红包,姐姐只回复“收到”二字,引发其强烈不满

悲哀!外甥考上西南交大,男子特意送上1688元升学红包,姐姐只回复“收到”二字,引发其强烈不满

火山詩话
2026-07-22 17:24:45
厨师离职,老板要求交出配方?步骤不写清,不结工资……法院判了

厨师离职,老板要求交出配方?步骤不写清,不结工资……法院判了

极目新闻
2026-07-21 17:46:40
特朗普宣布两年后对仿制药征收100%关税,对中国医药出口影响有这些

特朗普宣布两年后对仿制药征收100%关税,对中国医药出口影响有这些

第一财经资讯
2026-07-22 11:22:01
2026-07-22 18:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13577文章数 142698关注度
往期回顾 全部

科技要闻

马斯克看笑了:谷歌什么都有 偏偏没最强AI

头条要闻

美军公布最新对伊战事损失:18人阵亡 耗费375亿美金

头条要闻

美军公布最新对伊战事损失:18人阵亡 耗费375亿美金

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

47岁汤唯宣布二胎产子 大女儿10岁

财经要闻

美国想对中国AI动手?"大人,时代变了"

汽车要闻

上汽贾健旭谈汽车全球化:出海要合规 欧洲人只爱小车是误解

态度原创

旅游
房产
艺术
时尚
游戏

旅游要闻

暑假去哪儿?非遗手作、VR看展 德州博物馆成热门亲子打卡地

房产要闻

冲刺500亿美元IPO,海南又要迎来超级巨头!

艺术要闻

书坛唯一能称为大师的人,他的字俗人看不懂

赫本小白裙,简单纯粹!

网红浣熊“入侵”多款游戏!身形蠢萌引网友喜爱

无障碍浏览 进入关怀版