苹果提出DSAS:只在需要时干预,缓解激活引导的模型性能损耗
苹果研究团队提出Dynamically Scaled Activation Steering(DSAS),一种与具体引导方法无关的框架,将“何时引导”与“如何引导”解耦,在检测到不良行为时才加大干预力度,从而在毒性缓解与模型效用之间取得更好的权衡。
AI解读:激活引导(activation steering)是控制生成模型行为的常用手段,但现有方法大多对所有输入一视同仁地施加干预,不需要引导时反而拖累模型表现。苹果这篇论文提出的DSAS把“何时引导”和“如何引导”拆开:生成时按上下文算出缩放因子,只在检测到不良行为时才加强干预,并可在层与输入两个维度上调节现有引导变换的强度。
对实际使用者来说,这意味着安全干预不再是全局开关。论文报告称,DSAS与现有引导方法结合后,在毒性缓解与效用保留的权衡(Pareto前沿)上持续优于单独使用引导,同时只引入很小的计算开销。
论文还展示了方法的通用性:把自适应引导用于文生图扩散模型,可以按概念进行调节。此外DSAS能指出哪些token需要引导、强度多少,提升了可解释性。该论文被NeurIPS 2025的UniReps研讨会接收,代码将在GitHub发布。需要注意,以上信息来自论文摘要,具体实验数字、数据集与限制未在摘要中给出。
苹果机器学习研究(Apple Machine Learning Research)发布论文《Dynamically Scaled Activation Steering》,作者为Alex Ferrando de las Morenas†、Xavier Suau Cuadros、Jordi Gonzàlez Sabaté†、Pau Rodríguez Lopez,其中†标注单位为Centre de Visió per Computador。论文被NeurIPS 2025的Workshop on Unifying Representations in Neural Models(UniReps)接收。
论文指出,激活引导已成为引导生成模型行为(例如缓解毒性)的有效方法,但多数现有方法对所有输入统一施加干预,在不需要引导时会降低模型性能。
为此,作者提出Dynamically Scaled Activation Steering(DSAS),一种与具体引导方法无关的框架,将“何时引导”与“如何引导”解耦。DSAS会跨层和输入自适应地调节现有引导变换的强度,只在检测到不良行为时才强力干预。
在生成阶段,DSAS计算依赖上下文的缩放因子,选择性地调整任意一种引导方法的强度;论文还展示了如何将DSAS与引导函数端到端联合优化。
论文称,与现有引导方法结合时,DSAS相对单独使用引导持续改善Pareto前沿,在毒性缓解与效用保留之间取得更好的权衡。
论文进一步将DSAS应用于文生图扩散模型,展示自适应引导可以调节特定概念;DSAS仅引入极小的计算开销,同时提升可解释性,能定位哪些token需要引导以及引导强度。作者表示代码将在GitHub发布。