一篇题为《Dynamically Scaled Activation Steering》的论文提出了名为 DSAS 的方法。作者为 Alex Ferrando de las Morenas、Xavier Suau Cuadros、Jordi González Sabaté 和 Pau Rodríguez Lopez,论文于 2026 年 9 月发表。
论文指出,激活引导(activation steering)已成为一种有效方法,可引导生成模型的行为朝向期望结果,例如毒性缓解。但大多数现有方法对所有输入统一施加干预,当引导不必要时会降低模型性能。
![]()
DSAS 被定义为一个与具体方法无关的引导框架,将“何时引导”与“如何引导”解耦。DSAS 跨层、跨输入自适应地调节已有引导变换的强度,仅在检测到不期望行为时施加强干预。在生成阶段,DSAS 计算依赖上下文的缩放因子,选择性地调整任意引导方法的强度。论文还展示了 DSAS 可与引导函数一起进行端到端联合优化。
评估结果显示,将 DSAS 与现有引导方法结合使用时,相比单独使用引导,DSAS 能持续改善帕累托前沿,在毒性缓解与效用保留之间取得更好的权衡。论文进一步将 DSAS 应用于文本到图像的扩散模型,表明自适应引导可以调节特定概念,以此展示其通用性。
论文还提到,DSAS 引入的计算开销极小,同时提升了可解释性,能够指出哪些 token 需要引导以及需要引导多少。代码将在 GitHub 上公开。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.