随着大模型人工智能快速普及,各类AI工具走进大众的日常生活。不少人用AI写文案、整理资料、构思方案,AI已经成为工作学习当中的辅助工具。但近期有测试曝光,DeepSeek大模型依旧存在生成涉黄违规内容的风险,在特定诱导提示下,模型会输出不符合公序良俗的文字信息。
这件事引发社会广泛讨论。很多人产生疑惑,各大AI厂商明明都设置了安全过滤机制,为什么还会出现漏洞?AI的安全防护到底存在哪些现实难题?普通用户在使用AI工具的时候,又该如何规避风险?面对AI生成违规内容的现象,企业、监管、使用者三方分别要承担什么样的责任?
先厘清事件基本情况。有网络测试人员开展专项测试,通过构造特殊的诱导提问、变形提示词,尝试向DeepSeek大模型发起对话。在部分测试场景下,模型绕过安全防护规则,输出了低俗涉黄的文本内容。相关测试结果在网络上传播之后,引发大量网友关注。
需要说明的是,这类测试属于对抗性测试,也就是刻意构造违规指令去试探模型的安全底线。并非普通正常使用场景下,AI会主动输出不良内容。事件发生之后,相关企业也对外回应,会持续迭代安全防护体系,修补模型漏洞,优化内容过滤能力。全部完整的测试细节、官方整改公告,以企业公开声明为准。
很多网友看到消息之后,第一反应会觉得很不解。市面上几乎所有AI大模型,都配置了安全对齐、内容过滤、风险拦截模块。在正常对话的时候,一旦用户提出低俗、色情、暴力的请求,AI都会直接拒绝回复。那为什么经过特殊话术包装之后,就可以绕过防护,生成违规内容?
这里就要讲清楚大模型安全防护的现实难点。大模型本质是基于海量文本数据训练出来的人工智能,它的核心能力是学习文字之间的关联逻辑,并不是天生懂得分辨社会公序良俗。所谓的安全防护,是后期人为加上的一套约束体系。这套体系,主要分为两个部分。
第一部分是训练阶段的安全对齐。研发团队会整理大量违规样本,让模型学习识别不良指令,学会拒绝违规请求。第二部分是推理阶段的过滤拦截。也就是用户输入提问之后,系统会先做一层前置筛查,识别出风险指令,直接拦截,不让模型进行回复。
但现实当中,对抗诱导的手段一直在不断变化。测试人员会使用谐音、拆分语句、间接描述、隐喻、伪装成故事创作等方式,把违规诉求包装成看起来正常的提问。模型的安全过滤器,很难做到识别所有变形后的诱导话术。这也是当前全球大模型行业共同面对的技术难题,并不是某一家企业独有的问题。
我们可以举一个通俗的例子。好比设置一道门禁,正常的违规请求,就像是直接闯门,门禁可以直接拦住。但是有人会换各种伪装方式,乔装打扮之后尝试混进门内。防护系统可以挡住绝大多数常规的违规请求,但面对不断翻新的伪装话术,依然会存在漏判的可能性。
同时也要分清两个概念:模型本身的固有缺陷,和用户刻意恶意诱导,二者不能混为一谈。
正常普通用户日常使用,只是查询知识、写工作文稿、做学习辅助,几乎不会触发这类风险。只有在用户刻意构造特殊提示词,主动试探模型安全底线的时候,才有可能出现违规输出。并不是AI会主动输出低俗内容,而是在人为的特殊诱导之下,防护机制出现失效。
这一点也可以解释,为什么国内外多款主流大模型,都曾经被对抗测试爆出过安全漏洞。这是行业共性挑战,不是单一产品的特例。技术防护没有办法做到百分之百完美,不存在可以抵御所有恶意诱导的AI模型。
接下来分析,AI大模型出现安全漏洞,会带来哪些现实危害。
第一,对未成年人造成不良影响。未成年人辨别能力有限,如果接触到AI生成的低俗色情文字,会对身心健康带来负面影响。部分不法分子会利用模型漏洞,批量生成不良文本,在网络上传播扩散。
第二,助长网络不良内容的生产。少数别有用心的人,利用模型绕过安全限制,批量生成低俗、擦边文案,用于引流、发布不良信息,增加网络治理的难度。
第三,会给普通使用者带来困扰。如果普通用户在不知情的情况下,收到AI输出的违规内容,会产生不好的使用体验。
第四,会引发行业信任危机。当模型安全防护频繁出现漏洞,大众会对人工智能工具产生不信任,也会阻碍AI技术正常的普及应用。
正是因为存在以上风险,国家出台了生成式人工智能服务管理暂行办法,对国内大模型的上线运营做出明确要求。规定AI服务商必须落实内容安全主体责任,建立健全内容审核机制,持续优化安全防护,对于生成的内容进行管控。
法规明确要求,提供生成式AI服务,不能生成宣扬色情暴力、违背公序良俗的内容。企业需要不断迭代模型,及时修补安全漏洞,对用户的输入输出进行风险管控。
但法规落地执行的过程当中,也会遇到现实难题。技术迭代的速度,跟不上恶意诱导话术更新的速度。不法分子会不断研究新的提示词技巧,想方设法绕过防护。企业需要持续投入人力、算力,不断更新安全样本,优化模型,这是一项长期持续的工作,不是上线一次就可以一劳永逸。
很多人会产生疑问,既然技术很难做到万无一失,那该怎么去守住AI的安全边界?我们可以从企业、监管、普通用户三个角度来看待这件事。
首先是AI企业,作为第一责任主体。
第一,要持续完善安全对齐训练,扩充违规样本库。收集各类对抗诱导的案例,把变形、隐喻、间接表述的违规提示纳入训练样本,提升模型识别隐蔽风险的能力。
第二,强化前后双重过滤机制。输入环节做风险识别,输出之后也要二次校验。就算模型生成了违规内容,输出环节也要能够拦截,不把不良内容展示给用户。
第三,建立反馈渠道。面向用户开放举报入口。普通用户如果遇到AI输出违规内容,可以快速反馈,企业收到反馈之后,快速定位漏洞,完成模型迭代修复。
第四,区分不同用户群体。针对未成年人使用场景,开启更强的安全防护模式,限制风险输出,保护青少年群体。
第五,正视安全漏洞,不要回避问题。出现安全问题之后,及时公开说明,积极整改,而不是掩盖问题。
其次是监管层面。
监管部门持续完善相关规范,对大模型服务开展常态化监督检查。督促企业落实主体责任,对于安全防护不到位、屡次出现违规输出的服务商,依法开展处置。同时鼓励行业内部开展对抗测试,通过外部测试发现模型隐藏漏洞,推动整个行业安全能力提升。
最重要的,就是普通用户该如何做好自我防护。很多人以为,AI工具的安全全部靠厂商,自己不需要做任何防范。实际上,用户的行为同样会影响AI输出结果。这里整理普通人可以直接使用的实用建议。
第一,不要刻意去试探AI的安全底线。不要构造各类变形提示词,尝试诱导AI生成低俗、暴力、违法的内容。刻意进行对抗测试,不仅会产生不良内容,本身也违背公序良俗。
第二,区分AI的输出,不能全盘照搬。AI生成的文字,存在出错、生成违规内容的可能性。不管是工作、学习使用,输出内容一定要自己阅读审核,不要直接复制粘贴对外发布。
第三,未成年人使用AI工具,建议家长做好监护。尽量使用开启青少年模式的AI产品,避免孩子单独使用AI工具,防止接触不良信息。
第四,如果遇到AI输出低俗违规内容,不要转发扩散。第一时间向平台进行举报反馈,帮助厂商定位漏洞。不要把测试得到的不良内容,在社交平台传播,避免二次扩散不良信息。
第五,谨慎使用来路不明的AI工具。市面上有不少非正规的AI小程序、第三方模型,没有完善的安全防护。这类工具更容易输出违规内容,尽量选择正规大厂上线的AI产品。
接下来梳理大众对于AI安全的常见认知误区,逐一纠正。
误区一:只要AI出现可以生成涉黄内容的漏洞,就代表这个AI完全不能使用。
纠正:绝大多数场景下,正规大模型可以有效拦截常规违规请求。漏洞大多出现在人为刻意构造的对抗诱导场景。不能因为存在技术漏洞,全盘否定AI的实用价值。重点在于持续修补漏洞,而不是全盘否定技术。
误区二:AI只要完成一次安全训练,就永远不会出现安全问题。
纠正:安全防护是动态迭代的过程。新的诱导话术不断出现,模型需要持续更新样本,不断优化。没有一劳永逸的安全模型。
误区三:所有AI违规输出,全部都是企业的责任,和用户没有关系。
纠正:企业需要承担主体安全责任,但部分违规输出,来自用户主动构造恶意提示词。使用者不应该主动去诱导AI产出不良内容。
误区四:对抗测试曝光AI漏洞,就是为了抹黑产品。
纠正:合理的对抗测试,是帮助企业发现隐藏漏洞,推动行业安全进步。但不应该把测试出来的不良内容随意在网络传播,造成二次不良扩散。
误区五:只要开启青少年模式,就可以完全杜绝不良内容。
纠正:青少年模式可以大幅降低风险,但技术依旧存在局限性。家长的监护依然不可或缺。
误区六:AI大模型出现漏洞,说明AI技术本身就是有害的。
纠正:AI只是工具。工具本身没有善恶,风险来源于使用方式。AI可以帮助办公学习,同时也存在被恶意利用的风险,需要配套防护机制。
误区七:普通用户没有办法规避AI带来的风险,只能被动接受。
纠正:普通用户可以做到不主动诱导、审核输出内容、选择正规产品、遇到问题及时举报,这些行为都能够降低自身遇到不良内容的概率。
回到DeepSeek被曝出存在涉黄生成漏洞这件事。这件事不只是某一款产品的问题,更是整个生成式AI行业需要面对的现实考题。人工智能发展速度飞快,技术能力迭代很快,但是安全防护体系的建设,需要同步跟上。
技术发展不能只追求能力强大,安全底线必须放在同等重要的位置。如果只追求模型回答能力,忽略内容安全,技术带来的风险就会被放大。
我们也可以看到,近些年来国内AI行业,安全建设的投入正在不断加大。各大厂商都组建专门的安全团队,持续做对抗样本的研究,不断迭代模型。但我们也要客观认清现实,完全做到零漏洞,在现阶段技术条件下还很难实现。
这也提醒我们,看待AI技术要保持理性。一方面,看到AI给工作、学习带来的便利,用好这个工具;另一方面,也要认清它存在的局限性,不能把AI当成完全可靠的万能工具。
很多人会问,未来AI安全会走向什么方向?
未来的大模型,安全能力会持续升级。会结合更多技术手段,识别各种伪装的诱导指令。同时行业会形成统一的安全标准,完善测试体系。但即便如此,也很难实现绝对的零风险。所以,企业、监管、用户三方的协同,缺一不可。企业守住主体责任,监管做好监督,用户规范自身使用行为,多方共同构建防护网。
还有一个现实值得思考:网络上有一部分人,热衷于寻找AI的安全漏洞,把诱导AI产出违规内容当成一种“玩梗”。这种行为,看似只是趣味测试,实际上会带来不小的隐患。一旦不良内容被传播,会对很多网民,尤其是青少年造成伤害。网络上的趣味试探,不能突破公序良俗的底线。
对于普通使用者来说,不必过度恐慌。日常正常使用AI,用来写材料、查资料、做学习辅助,遇到违规输出的概率很低。我们需要做的,就是保持清醒,不主动试探模型底线,对AI输出的内容保持甄别,遇到问题及时举报。
总结全文核心要点:DeepSeek被曝出可在特殊诱导下生成涉黄内容,反映出当前大模型行业普遍存在的安全防护难题。大模型安全防护无法做到百分之百完美,对抗性诱导会给安全过滤带来挑战。企业需要落实主体责任,持续迭代安全模型,完善输入输出双重校验。监管部门持续开展监督,推动行业安全建设。普通用户应当拒绝刻意诱导AI生成不良内容,优先选用正规AI产品,对AI输出内容做好审核,遇到违规内容及时举报。AI是一把工具,技术发展要兼顾能力提升与安全底线,多方协同,才能守住人工智能的安全边界。
免责声明:本文为AI安全科普,相关事件细节以企业官方公告为准。AI工具存在局限性,使用过程中请理性甄别输出内容。
你平时会使用AI工具吗?你认为AI的安全防护最该重点做好哪些方面?欢迎在评论区留言交流,点个关注,持续分享科技安全科普。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.