目前行业主流的两条技术路线,各自都有很难靠局部优化绕开的结构性瓶颈。我整理了一点自己的思路。
目前主流的防护方案,本质上可以归为两条路线:
- 外挂式护栏
在主模型之外独立部署一套安全审核模型,对输入提示、输出文本做串行或并行的语义校验。
优势:和基座模型完全解耦,不会引入对齐损耗,安全规则迭代灵活,业务侧改动成本低;
核心短板:天生存在观测维度的盲区。只能接触生成完成后、坍缩成离散词元的表层文本,完全感知不到生成过程中内部语义状态的动态演化。面对渐进式语境铺垫、弥散型语义注入这类「表面合规、过程跑偏」的攻击手段,基本没有太好的应对方式 —— 这不是模型能力不够强,是信息源层面的先天限制。
- 参数对齐训练
通过 RLHF、SFT 等方式,把安全规则直接训练进模型权重里,实现「生成即合规」。
优势:安全约束贯穿生成全流程,推理阶段没有额外的审核延迟,流式输出体验好;
核心短板:代价是不可避免的「对齐税」—— 安全约束会扭曲模型原生的高维语义分布,导致通用推理能力、创造力出现不同程度的衰减;同时规则迭代成本极高,单条规则调整往往也需要重新做微调,周期长达数天;更关键的是,安全判断完全黑盒化,既无法独立审计,也很难解释某一次拒答的具体依据。
这两条路线看似方向完全相反,但有一个共同的底层局限:安全判断的观测对象,始终是「生成的产物」,而非「生成的过程本身」。
基于这个痛点,我构思了第三种架构方向 ——内生安全观测通路:
既不在模型外另起一套完整的计算链路,也不把安全规则硬训进主干权重里,而是在模型原生的推理链路中,引出一条独立、单向只读的安全观测通路。
核心设计有三点:
特征源下沉:安全通路的输入不取自最终输出文本,而是直接读取主干 Transformer 中间层(通常是总层数 1/2 ~ 2/3 区间的语义聚合层)的隐状态特征;
单向计算隔离:安全通路仅执行特征读取与分类运算,不反向修改主干网络的计算结果,也不会向生成通路的特征计算链路回流任何数据;
规则热更新:安全规则以独立约束表征的形式存在,支持在线热更新,不需要重新训练基座模型。
这套架构如果落地,理论上可以同时实现三个传统方案很难兼顾的目标:
过程级可见性:在语义偏移尚未输出为文本时就能识别,补上外挂护栏的信息维度短板;
零对齐损耗:不修改主干权重,完整保留模型原生的生成能力与推理精度;
低边际开销:共享主干前向计算的中间结果,安全检测带来的算力与延迟增量极低。
我把更完整的思路整理成了一篇技术短文,放在这里供大家参考,也欢迎聊聊不同的落地可能性
https://zenodo.org/records/21496034
目前行业主流的两条技术路线,各自都有很难靠局部优化绕开的结构性瓶颈。我整理了一点自己的思路。
目前主流的防护方案,本质上可以归为两条路线:
在主模型之外独立部署一套安全审核模型,对输入提示、输出文本做串行或并行的语义校验。
优势:和基座模型完全解耦,不会引入对齐损耗,安全规则迭代灵活,业务侧改动成本低;
核心短板:天生存在观测维度的盲区。只能接触生成完成后、坍缩成离散词元的表层文本,完全感知不到生成过程中内部语义状态的动态演化。面对渐进式语境铺垫、弥散型语义注入这类「表面合规、过程跑偏」的攻击手段,基本没有太好的应对方式 —— 这不是模型能力不够强,是信息源层面的先天限制。
通过 RLHF、SFT 等方式,把安全规则直接训练进模型权重里,实现「生成即合规」。
优势:安全约束贯穿生成全流程,推理阶段没有额外的审核延迟,流式输出体验好;
核心短板:代价是不可避免的「对齐税」—— 安全约束会扭曲模型原生的高维语义分布,导致通用推理能力、创造力出现不同程度的衰减;同时规则迭代成本极高,单条规则调整往往也需要重新做微调,周期长达数天;更关键的是,安全判断完全黑盒化,既无法独立审计,也很难解释某一次拒答的具体依据。
这两条路线看似方向完全相反,但有一个共同的底层局限:安全判断的观测对象,始终是「生成的产物」,而非「生成的过程本身」。
基于这个痛点,我构思了第三种架构方向 ——内生安全观测通路:
既不在模型外另起一套完整的计算链路,也不把安全规则硬训进主干权重里,而是在模型原生的推理链路中,引出一条独立、单向只读的安全观测通路。
核心设计有三点:
特征源下沉:安全通路的输入不取自最终输出文本,而是直接读取主干 Transformer 中间层(通常是总层数 1/2 ~ 2/3 区间的语义聚合层)的隐状态特征;
单向计算隔离:安全通路仅执行特征读取与分类运算,不反向修改主干网络的计算结果,也不会向生成通路的特征计算链路回流任何数据;
规则热更新:安全规则以独立约束表征的形式存在,支持在线热更新,不需要重新训练基座模型。
这套架构如果落地,理论上可以同时实现三个传统方案很难兼顾的目标:
过程级可见性:在语义偏移尚未输出为文本时就能识别,补上外挂护栏的信息维度短板;
零对齐损耗:不修改主干权重,完整保留模型原生的生成能力与推理精度;
低边际开销:共享主干前向计算的中间结果,安全检测带来的算力与延迟增量极低。
我把更完整的思路整理成了一篇技术短文,放在这里供大家参考,也欢迎聊聊不同的落地可能性
https://zenodo.org/records/21496034