LatchBio 最近对 Grok 做了一次生物安全方向的“摸底考”。测试聚焦在生物安全监控和对抗性生物任务上,结果有点意思:Grok 4.6 能正确识别并拒绝危险查询,包括那些故意混淆、试图绕过检测的生物任务。
更关键的是,它在“拦得住”和“不误伤”之间找到了平衡点。面对恶意构造的请求,模型会果断拒绝;但如果是正常、有益的科学问题,它依然会正常回答,不会因为过度防御而把好问题也一并挡掉。
![]()
对抗性测试的看点
这类测试的难点在于,攻击者会故意把危险意图包装成无害的提问。Grok 4.6 的表现说明,它在识别这类“变体”上下了功夫——既能看穿伪装,又不影响常规科研场景下的使用体验。
xAI 官方博客也同步讨论了这次评测的细节和结果。对于关注 AI 安全边界的开发者来说,这算是一个值得留意的信号:模型的安全护栏,正在从“一刀切”走向更精细的识别能力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.