Skip to content

基于中间层隐状态读取的内生安全通路——替代外挂护栏与参数对齐的第三种架构 #10

Description

@ddzj2000

目前行业主流的两条技术路线,各自都有很难靠局部优化绕开的结构性瓶颈。我整理了一点自己的思路。
目前主流的防护方案,本质上可以归为两条路线:

  1. 外挂式护栏
    在主模型之外独立部署一套安全审核模型,对输入提示、输出文本做串行或并行的语义校验。
    优势:和基座模型完全解耦,不会引入对齐损耗,安全规则迭代灵活,业务侧改动成本低;
    核心短板:天生存在观测维度的盲区。只能接触生成完成后、坍缩成离散词元的表层文本,完全感知不到生成过程中内部语义状态的动态演化。面对渐进式语境铺垫、弥散型语义注入这类「表面合规、过程跑偏」的攻击手段,基本没有太好的应对方式 —— 这不是模型能力不够强,是信息源层面的先天限制。
  2. 参数对齐训练
    通过 RLHF、SFT 等方式,把安全规则直接训练进模型权重里,实现「生成即合规」。
    优势:安全约束贯穿生成全流程,推理阶段没有额外的审核延迟,流式输出体验好;
    核心短板:代价是不可避免的「对齐税」—— 安全约束会扭曲模型原生的高维语义分布,导致通用推理能力、创造力出现不同程度的衰减;同时规则迭代成本极高,单条规则调整往往也需要重新做微调,周期长达数天;更关键的是,安全判断完全黑盒化,既无法独立审计,也很难解释某一次拒答的具体依据。
    这两条路线看似方向完全相反,但有一个共同的底层局限:安全判断的观测对象,始终是「生成的产物」,而非「生成的过程本身」。
    基于这个痛点,我构思了第三种架构方向 ——内生安全观测通路:
    既不在模型外另起一套完整的计算链路,也不把安全规则硬训进主干权重里,而是在模型原生的推理链路中,引出一条独立、单向只读的安全观测通路。
    核心设计有三点:
    特征源下沉:安全通路的输入不取自最终输出文本,而是直接读取主干 Transformer 中间层(通常是总层数 1/2 ~ 2/3 区间的语义聚合层)的隐状态特征;
    单向计算隔离:安全通路仅执行特征读取与分类运算,不反向修改主干网络的计算结果,也不会向生成通路的特征计算链路回流任何数据;
    规则热更新:安全规则以独立约束表征的形式存在,支持在线热更新,不需要重新训练基座模型。
    这套架构如果落地,理论上可以同时实现三个传统方案很难兼顾的目标:
    过程级可见性:在语义偏移尚未输出为文本时就能识别,补上外挂护栏的信息维度短板;
    零对齐损耗:不修改主干权重,完整保留模型原生的生成能力与推理精度;
    低边际开销:共享主干前向计算的中间结果,安全检测带来的算力与延迟增量极低。
    我把更完整的思路整理成了一篇技术短文,放在这里供大家参考,也欢迎聊聊不同的落地可能性
    https://zenodo.org/records/21496034

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions