项目作者在发布页中表示:“让一个不可信的 AI 代理访问敏感数据,同时用数学保证任何个人记录都不会泄露——哪怕代理本身出错了、被操控了,甚至本身就是恶意的。”这番话直接点出了 Noisegate 的设计初衷。作为一个面向 AI 代理的差分隐私网关,它试图在开放查询权与数据安全之间找到一种可验证的平衡。
Noisegate 的工作方式很直白:它是一个夹在 AI 代理和底层数据库之间的中间层。代理可以向它发起自然语言查询,网关在数据返回前注入精心校准的噪声,使得单个个体的信息无法从统计结果中被反向提取。在公开演示中,一个 AI 代理尝试按诊断类别拆分 20 名患者的数据,每次提问都会被注入 ±12 的噪声,导致所有统计分箱都被噪声淹没。当代理连续发起三次提问耗尽预算后,网关直接返回拒绝响应,而不是给出一个更安静但隐私仍在流失的答案。
![]()
另一个演示在一份 32,561 行的普查数据集上运行,一次过于狭窄的切片在信任边界被直接拒绝,而一个满足隐私预算要求的完整教育程度分解查询则顺利通过。拒绝与放行之间的决策,完全由网关实时执行,不是靠猜测也不是靠事后补救。
为了证明系统不是在自说自话,项目方直接跑通了三种经典隐私攻击:差分化攻击、成员推断攻击和基于重新标识的个体锁定攻击。隐私关闭时,三种攻击全部得手;隐私打开后,同一种攻击方式被彻底阻断。这些测试都写入了自动化持续集成流水线,保证防御不会随着版本迭代而悄悄失效。
数学上的可信度也经过了独立比对。团队手工实现的噪声机制与差分隐私参考实现 OpenDP 进行了 35 个噪声尺度点的一致性校验,差异不超过 1e-9;同时在 50 万样本分布测试中用正向控制确保了测试本身是能失败的——也就是它真的具备检测能力。这意味着计算结果并非靠黑箱通过,而是有可复现的参照系。
更关键的实用指标来自隐私预算的记账方式。采用混合 zCDP 组合后,在同样的隐私保障前提下,Noisegate 允许完成 308 次查询,而朴素的预算记账方法在 100 次时就已耗尽。同一份隐私保证,查询量直接翻了 3 倍。对于需要连续追问、反复验证的分析场景,这种损耗控制会直接拉开实际可用性上的差距。
整套系统专门针对 AI 代理设计,以 MCP 服务器的形式直接接入 Claude Desktop,连接方从一开始就被视为不信任对象,所有隐私属性都在网关侧强制生效。开发团队坦言,当前版本仍在快速迭代中,但已展示出一套清晰的技术路径:在开放给代理查询权的同时,让隐私保护变成一道可验证、可审计的数学边界,而不是一句模糊的承诺。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.