网易首页 > 网易号 > 正文 申请入驻

曝DeepSeek仍可生成涉黄内容,AI安全边界该如何守住

0
分享至

随着大模型人工智能快速普及,各类AI工具走进大众的日常生活。不少人用AI写文案、整理资料、构思方案,AI已经成为工作学习当中的辅助工具。但近期有测试曝光,DeepSeek大模型依旧存在生成涉黄违规内容的风险,在特定诱导提示下,模型会输出不符合公序良俗的文字信息。

这件事引发社会广泛讨论。很多人产生疑惑,各大AI厂商明明都设置了安全过滤机制,为什么还会出现漏洞?AI的安全防护到底存在哪些现实难题?普通用户在使用AI工具的时候,又该如何规避风险?面对AI生成违规内容的现象,企业、监管、使用者三方分别要承担什么样的责任?

先厘清事件基本情况。有网络测试人员开展专项测试,通过构造特殊的诱导提问、变形提示词,尝试向DeepSeek大模型发起对话。在部分测试场景下,模型绕过安全防护规则,输出了低俗涉黄的文本内容。相关测试结果在网络上传播之后,引发大量网友关注。

需要说明的是,这类测试属于对抗性测试,也就是刻意构造违规指令去试探模型的安全底线。并非普通正常使用场景下,AI会主动输出不良内容。事件发生之后,相关企业也对外回应,会持续迭代安全防护体系,修补模型漏洞,优化内容过滤能力。全部完整的测试细节、官方整改公告,以企业公开声明为准。

很多网友看到消息之后,第一反应会觉得很不解。市面上几乎所有AI大模型,都配置了安全对齐、内容过滤、风险拦截模块。在正常对话的时候,一旦用户提出低俗、色情、暴力的请求,AI都会直接拒绝回复。那为什么经过特殊话术包装之后,就可以绕过防护,生成违规内容?

这里就要讲清楚大模型安全防护的现实难点。大模型本质是基于海量文本数据训练出来的人工智能,它的核心能力是学习文字之间的关联逻辑,并不是天生懂得分辨社会公序良俗。所谓的安全防护,是后期人为加上的一套约束体系。这套体系,主要分为两个部分。

第一部分是训练阶段的安全对齐。研发团队会整理大量违规样本,让模型学习识别不良指令,学会拒绝违规请求。第二部分是推理阶段的过滤拦截。也就是用户输入提问之后,系统会先做一层前置筛查,识别出风险指令,直接拦截,不让模型进行回复。

但现实当中,对抗诱导的手段一直在不断变化。测试人员会使用谐音、拆分语句、间接描述、隐喻、伪装成故事创作等方式,把违规诉求包装成看起来正常的提问。模型的安全过滤器,很难做到识别所有变形后的诱导话术。这也是当前全球大模型行业共同面对的技术难题,并不是某一家企业独有的问题。

我们可以举一个通俗的例子。好比设置一道门禁,正常的违规请求,就像是直接闯门,门禁可以直接拦住。但是有人会换各种伪装方式,乔装打扮之后尝试混进门内。防护系统可以挡住绝大多数常规的违规请求,但面对不断翻新的伪装话术,依然会存在漏判的可能性。

同时也要分清两个概念:模型本身的固有缺陷,和用户刻意恶意诱导,二者不能混为一谈。

正常普通用户日常使用,只是查询知识、写工作文稿、做学习辅助,几乎不会触发这类风险。只有在用户刻意构造特殊提示词,主动试探模型安全底线的时候,才有可能出现违规输出。并不是AI会主动输出低俗内容,而是在人为的特殊诱导之下,防护机制出现失效。

这一点也可以解释,为什么国内外多款主流大模型,都曾经被对抗测试爆出过安全漏洞。这是行业共性挑战,不是单一产品的特例。技术防护没有办法做到百分之百完美,不存在可以抵御所有恶意诱导的AI模型。

接下来分析,AI大模型出现安全漏洞,会带来哪些现实危害。

第一,对未成年人造成不良影响。未成年人辨别能力有限,如果接触到AI生成的低俗色情文字,会对身心健康带来负面影响。部分不法分子会利用模型漏洞,批量生成不良文本,在网络上传播扩散。

第二,助长网络不良内容的生产。少数别有用心的人,利用模型绕过安全限制,批量生成低俗、擦边文案,用于引流、发布不良信息,增加网络治理的难度。

第三,会给普通使用者带来困扰。如果普通用户在不知情的情况下,收到AI输出的违规内容,会产生不好的使用体验。

第四,会引发行业信任危机。当模型安全防护频繁出现漏洞,大众会对人工智能工具产生不信任,也会阻碍AI技术正常的普及应用。

正是因为存在以上风险,国家出台了生成式人工智能服务管理暂行办法,对国内大模型的上线运营做出明确要求。规定AI服务商必须落实内容安全主体责任,建立健全内容审核机制,持续优化安全防护,对于生成的内容进行管控。

法规明确要求,提供生成式AI服务,不能生成宣扬色情暴力、违背公序良俗的内容。企业需要不断迭代模型,及时修补安全漏洞,对用户的输入输出进行风险管控。

但法规落地执行的过程当中,也会遇到现实难题。技术迭代的速度,跟不上恶意诱导话术更新的速度。不法分子会不断研究新的提示词技巧,想方设法绕过防护。企业需要持续投入人力、算力,不断更新安全样本,优化模型,这是一项长期持续的工作,不是上线一次就可以一劳永逸。

很多人会产生疑问,既然技术很难做到万无一失,那该怎么去守住AI的安全边界?我们可以从企业、监管、普通用户三个角度来看待这件事。

首先是AI企业,作为第一责任主体。

第一,要持续完善安全对齐训练,扩充违规样本库。收集各类对抗诱导的案例,把变形、隐喻、间接表述的违规提示纳入训练样本,提升模型识别隐蔽风险的能力。

第二,强化前后双重过滤机制。输入环节做风险识别,输出之后也要二次校验。就算模型生成了违规内容,输出环节也要能够拦截,不把不良内容展示给用户。

第三,建立反馈渠道。面向用户开放举报入口。普通用户如果遇到AI输出违规内容,可以快速反馈,企业收到反馈之后,快速定位漏洞,完成模型迭代修复。

第四,区分不同用户群体。针对未成年人使用场景,开启更强的安全防护模式,限制风险输出,保护青少年群体。

第五,正视安全漏洞,不要回避问题。出现安全问题之后,及时公开说明,积极整改,而不是掩盖问题。

其次是监管层面。

监管部门持续完善相关规范,对大模型服务开展常态化监督检查。督促企业落实主体责任,对于安全防护不到位、屡次出现违规输出的服务商,依法开展处置。同时鼓励行业内部开展对抗测试,通过外部测试发现模型隐藏漏洞,推动整个行业安全能力提升。

最重要的,就是普通用户该如何做好自我防护。很多人以为,AI工具的安全全部靠厂商,自己不需要做任何防范。实际上,用户的行为同样会影响AI输出结果。这里整理普通人可以直接使用的实用建议。

第一,不要刻意去试探AI的安全底线。不要构造各类变形提示词,尝试诱导AI生成低俗、暴力、违法的内容。刻意进行对抗测试,不仅会产生不良内容,本身也违背公序良俗。

第二,区分AI的输出,不能全盘照搬。AI生成的文字,存在出错、生成违规内容的可能性。不管是工作、学习使用,输出内容一定要自己阅读审核,不要直接复制粘贴对外发布。

第三,未成年人使用AI工具,建议家长做好监护。尽量使用开启青少年模式的AI产品,避免孩子单独使用AI工具,防止接触不良信息。

第四,如果遇到AI输出低俗违规内容,不要转发扩散。第一时间向平台进行举报反馈,帮助厂商定位漏洞。不要把测试得到的不良内容,在社交平台传播,避免二次扩散不良信息。

第五,谨慎使用来路不明的AI工具。市面上有不少非正规的AI小程序、第三方模型,没有完善的安全防护。这类工具更容易输出违规内容,尽量选择正规大厂上线的AI产品。

接下来梳理大众对于AI安全的常见认知误区,逐一纠正。

误区一:只要AI出现可以生成涉黄内容的漏洞,就代表这个AI完全不能使用。

纠正:绝大多数场景下,正规大模型可以有效拦截常规违规请求。漏洞大多出现在人为刻意构造的对抗诱导场景。不能因为存在技术漏洞,全盘否定AI的实用价值。重点在于持续修补漏洞,而不是全盘否定技术。

误区二:AI只要完成一次安全训练,就永远不会出现安全问题。

纠正:安全防护是动态迭代的过程。新的诱导话术不断出现,模型需要持续更新样本,不断优化。没有一劳永逸的安全模型。

误区三:所有AI违规输出,全部都是企业的责任,和用户没有关系。

纠正:企业需要承担主体安全责任,但部分违规输出,来自用户主动构造恶意提示词。使用者不应该主动去诱导AI产出不良内容。

误区四:对抗测试曝光AI漏洞,就是为了抹黑产品。

纠正:合理的对抗测试,是帮助企业发现隐藏漏洞,推动行业安全进步。但不应该把测试出来的不良内容随意在网络传播,造成二次不良扩散。

误区五:只要开启青少年模式,就可以完全杜绝不良内容。

纠正:青少年模式可以大幅降低风险,但技术依旧存在局限性。家长的监护依然不可或缺。

误区六:AI大模型出现漏洞,说明AI技术本身就是有害的。

纠正:AI只是工具。工具本身没有善恶,风险来源于使用方式。AI可以帮助办公学习,同时也存在被恶意利用的风险,需要配套防护机制。

误区七:普通用户没有办法规避AI带来的风险,只能被动接受。

纠正:普通用户可以做到不主动诱导、审核输出内容、选择正规产品、遇到问题及时举报,这些行为都能够降低自身遇到不良内容的概率。

回到DeepSeek被曝出存在涉黄生成漏洞这件事。这件事不只是某一款产品的问题,更是整个生成式AI行业需要面对的现实考题。人工智能发展速度飞快,技术能力迭代很快,但是安全防护体系的建设,需要同步跟上。

技术发展不能只追求能力强大,安全底线必须放在同等重要的位置。如果只追求模型回答能力,忽略内容安全,技术带来的风险就会被放大。

我们也可以看到,近些年来国内AI行业,安全建设的投入正在不断加大。各大厂商都组建专门的安全团队,持续做对抗样本的研究,不断迭代模型。但我们也要客观认清现实,完全做到零漏洞,在现阶段技术条件下还很难实现。

这也提醒我们,看待AI技术要保持理性。一方面,看到AI给工作、学习带来的便利,用好这个工具;另一方面,也要认清它存在的局限性,不能把AI当成完全可靠的万能工具。

很多人会问,未来AI安全会走向什么方向?

未来的大模型,安全能力会持续升级。会结合更多技术手段,识别各种伪装的诱导指令。同时行业会形成统一的安全标准,完善测试体系。但即便如此,也很难实现绝对的零风险。所以,企业、监管、用户三方的协同,缺一不可。企业守住主体责任,监管做好监督,用户规范自身使用行为,多方共同构建防护网。

还有一个现实值得思考:网络上有一部分人,热衷于寻找AI的安全漏洞,把诱导AI产出违规内容当成一种“玩梗”。这种行为,看似只是趣味测试,实际上会带来不小的隐患。一旦不良内容被传播,会对很多网民,尤其是青少年造成伤害。网络上的趣味试探,不能突破公序良俗的底线。

对于普通使用者来说,不必过度恐慌。日常正常使用AI,用来写材料、查资料、做学习辅助,遇到违规输出的概率很低。我们需要做的,就是保持清醒,不主动试探模型底线,对AI输出的内容保持甄别,遇到问题及时举报。

总结全文核心要点:DeepSeek被曝出可在特殊诱导下生成涉黄内容,反映出当前大模型行业普遍存在的安全防护难题。大模型安全防护无法做到百分之百完美,对抗性诱导会给安全过滤带来挑战。企业需要落实主体责任,持续迭代安全模型,完善输入输出双重校验。监管部门持续开展监督,推动行业安全建设。普通用户应当拒绝刻意诱导AI生成不良内容,优先选用正规AI产品,对AI输出内容做好审核,遇到违规内容及时举报。AI是一把工具,技术发展要兼顾能力提升与安全底线,多方协同,才能守住人工智能的安全边界。

免责声明:本文为AI安全科普,相关事件细节以企业官方公告为准。AI工具存在局限性,使用过程中请理性甄别输出内容。

你平时会使用AI工具吗?你认为AI的安全防护最该重点做好哪些方面?欢迎在评论区留言交流,点个关注,持续分享科技安全科普。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
印度小伙来中国,与中国姑娘交往2个月被踹,姑娘:我现在全身病

印度小伙来中国,与中国姑娘交往2个月被踹,姑娘:我现在全身病

悬案解密档案
2025-05-21 10:46:02
两性关系:发现了没,寿命长的男人,大多都有这五个好习惯

两性关系:发现了没,寿命长的男人,大多都有这五个好习惯

荔子言
2026-09-08 14:55:50
果然不留!高市新内阁名单出炉,林芳正出局,或扛“反高市”大旗

果然不留!高市新内阁名单出炉,林芳正出局,或扛“反高市”大旗

琴音缭绕回
2026-09-17 15:35:12
WTT球星赛冷门迭爆:国乒小将3-2掀翻世乒赛冠军,薛飞首轮崩盘,方博一轮游

WTT球星赛冷门迭爆:国乒小将3-2掀翻世乒赛冠军,薛飞首轮崩盘,方博一轮游

好乒乓
2026-09-18 00:54:14
广州突发伤人事件:最该有的保命习惯,在外不要玩手机不要戴耳机

广州突发伤人事件:最该有的保命习惯,在外不要玩手机不要戴耳机

西虹市闲话
2026-09-15 10:49:51
韩媒:日本亚运会表演出现“丰臣秀吉”引韩方强烈不满,日本亚组委回应

韩媒:日本亚运会表演出现“丰臣秀吉”引韩方强烈不满,日本亚组委回应

环球网资讯
2026-09-17 11:49:06
劳斯莱斯接亲途中发生车祸,受损严重,车主:车借给朋友接亲,车辆无保险需自费维修,修车费预计几十万元;当地派出所介入处理

劳斯莱斯接亲途中发生车祸,受损严重,车主:车借给朋友接亲,车辆无保险需自费维修,修车费预计几十万元;当地派出所介入处理

极目新闻
2026-09-17 15:54:34
国锦赛一夜2场冷门!中国军团4胜1负,张安达、霍金斯都造6-0惨案

国锦赛一夜2场冷门!中国军团4胜1负,张安达、霍金斯都造6-0惨案

小火箭爱体育
2026-09-17 22:32:35
深夜爆大瓜!匿名爆料引爆热搜:网传85花与前辈老公已离婚,约定等孩子长大再官宣

深夜爆大瓜!匿名爆料引爆热搜:网传85花与前辈老公已离婚,约定等孩子长大再官宣

火山詩话
2026-09-18 05:06:28
38岁韦雪“见光死”,生图脸大肩窄矮小,穿堆堆袜邋遢,目测一米五

38岁韦雪“见光死”,生图脸大肩窄矮小,穿堆堆袜邋遢,目测一米五

原梦叁生
2026-09-17 18:11:44
香山论坛突发意外!中方受邀贵宾被扣,总理斡旋,对方登门谢罪

香山论坛突发意外!中方受邀贵宾被扣,总理斡旋,对方登门谢罪

杜鱂手工制作
2026-09-16 16:20:14
沙特用自身遭遇证明:土耳其和巴基斯坦并不适合成为真正的忠实盟友

沙特用自身遭遇证明:土耳其和巴基斯坦并不适合成为真正的忠实盟友

寰球经纬所
2026-09-16 21:27:21
不服就干!韩国打响反华第一枪,通告全球,妄想掐断中方退路?

不服就干!韩国打响反华第一枪,通告全球,妄想掐断中方退路?

影孖看世界
2026-09-16 22:38:51
认得3个算我输!50年前的6样老物件,第1个就难倒我,最后一个村长也认不出

认得3个算我输!50年前的6样老物件,第1个就难倒我,最后一个村长也认不出

白浅娱乐聊
2026-09-17 02:34:21
贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

唠叨说历史
2026-09-15 14:16:32
国内严控,海外严查,华人的钱流动难

国内严控,海外严查,华人的钱流动难

以希腊之名
2026-09-17 16:51:51
国家卫健委呼吁多喝白开水!最新研究:水烧开,微塑料摄入暴跌70%-80%,且还能控糖,但要静置后再喝

国家卫健委呼吁多喝白开水!最新研究:水烧开,微塑料摄入暴跌70%-80%,且还能控糖,但要静置后再喝

梅斯医学
2026-09-16 07:54:38
办不起就别办!中国队自费住酒店,泰国队机场打地铺,印度队最惨

办不起就别办!中国队自费住酒店,泰国队机场打地铺,印度队最惨

天马幸福的人生
2026-09-17 20:25:07
五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

路医生健康科普
2026-08-03 15:25:14
体制内的饭局基本消失了

体制内的饭局基本消失了

砚田文化
2026-09-16 18:33:32
2026-09-18 06:32:49
呼呼历史论
呼呼历史论
分享有趣的历史
776文章数 18137关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

亲子
时尚
旅游
本地
房产

亲子要闻

小恐龙选择了紫色的旺旺碎冰冰

潮流之向,自有回响——浪潮音乐大赏特别企划

旅游要闻

烟花+戏剧+赛事全拉满!长江口吴淞岸线带你解锁中秋国庆滨江新玩法

本地新闻

不止胖东来!许昌藏着半部三国史

房产要闻

突发!三亚安居房出台新政!

无障碍浏览 进入关怀版