NeurIPS’24&TPAMI’26|用KernelPCA理解分布外检测:从非线性特征子空间到高效核近似

admin 2026-07-19 05:04:00 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 该论文提出基于核主成分分析(KPCA)的分布外检测框架,从非线性特征子空间角度理解问题。核心贡献包括设计Cosine-Gaussian核以捕捉特征范数不平衡与距离关系两种关键非线性模式,并采用随机傅里叶特征(RFF)和Nystrom近似实现大规模高效计算,其中提出面向检测的low-energylandmark采样策略。在ImageNet-1K基准上,该方法取得强检测性能且推理开销低,展示了经典核学习与分布外检测结合的潜力。 综合评分: 85 文章分类: AI安全,安全工具,解决方案,应用安全,技术标准


cover_image

NeurIPS’24 & TPAMI’26 | 用 Kernel PCA 理解分布外检测:从非线性特征子空间到高效核近似

AIForSecurity AIForSecurity

AI安全这点事

2026年7月18日 22:06 安徽

在小说阅读器读本章

去阅读

NeurIPS’24 & TPAMI’26 | 用 Kernel PCA 理解分布外检测:从非线性特征子空间到高效核近似

论文概览

  • 论文题目:Kernel PCA for Out-of-Distribution Detection: Non-Linear Kernel Selection and Approximation
  • 作者团队:Kun Fang, Qinghua Tao, Mingzhen He, Kexin Lv, Runze Yang, Haibo Hu, Xiaolin Huang, Jie Yang, Longbing Cao
  • 作者单位:上海交通大学、香港理工大学、北京理工大学、中国移动上海产业研究院、澳大利亚麦考瑞大学等
  • 发表刊物NeurIPS 2024、IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 2026。
  • 核心内容:本文从非线性特征子空间的角度审视分布外检测问题。深度神经网络提取到的分布内数据特征虽然复杂,但仍可能集中在一个由分布内数据决定的低维非线性子空间中;而分布外数据特征由于分布不同,难以被该子空间有效重构。因此,本文利用核主成分分析(Kernel PCA,KPCA)学习分布内的非线性主成分,并以重构误差作为分布外检测分数。具体来说,本文找到一个合适的描述分布内和分布外数据差异性的非线性核,应用核近似技术以在大规模数据场景下高效计算重构误差,并讨论了如何将核学习应用到分布外检测任务中。

1. 研究背景与相关工作

随着深度神经网络在视觉识别、自动驾驶、医疗诊断和安全审计等场景中的广泛部署,模型是否能够识别“自己没见过的数据”变得尤为关键。训练集和测试集中的样本通常来自同一分布,被称为分布内(In-Distribution,InD)数据,而来自其他分布、类别或环境的数据则被称为分布外(Out-of-Distribution,OoD)数据。

当模型部署到真实场景中,极有可能会遇到 OoD 样本。如果模型对此类 OoD 样本仍然给出高置信度预测,就可能带来严重风险。因此,分布外检测任务对实现可信安全的深度学习具有重要意义。

现有方法大致可以分为三类:

  1. 基于 logits 的方法:利用最大 softmax 概率、最大 logit 或 energy score 判断异常样本。
  2. 基于梯度的方法:通过反向传播得到参数梯度,再利用梯度范数或梯度投影区分 InD 和 OoD。
  3. 基于特征的方法:直接在神经网络特征空间中设计检测分数,例如特征裁剪、Mahalanobis 距离、最近邻搜索、PCA 重构误差等。

这些方法虽然取得了不错的效果,但仍面临几个关键问题:

  1. Logits 信息较粗粒度:预测 logits 主要编码类别层面的信息,难以充分描述 InD 和 OoD 在特征空间中的细粒度差异。
  2. 梯度方法计算开销较高:梯度型检测通常需要额外反向传播,不适合对推理效率要求高的场景。
  3. 线性或直接距离度量不足:真实神经网络特征中的 InD 和 OoD 差异常常是非线性的,简单的欧氏距离、Mahalanobis 距离或线性 PCA 子空间难以完整刻画。

2. 核心思想:用非线性子空间刻画 InD-OoD 差异

本文的核心思想是:用非线性子空间刻画 InD-OoD 差异。通常来说,在 InD 数据上充分训练的神经网络能够将 InD 特征映射到一个低维子空间,而 OoD 数据往往并不能被这个子空间很好重构,因此,利用 InD 和 OoD 数据在这个特征子空间的可分性,我们可以计算它们的重构误差来实现 OoD 检测。同时,线性的特征子空间往往不足以描述 InD 和 OoD 数据之间的差异性,我们需要借助 Kernel PCA 引入非线性。基于这一思想,我们进一步面临如下两个挑战

  • 如何选择一个合适的刻画 InD-OoD 差异性的非线性核?
  • 如何解决核矩阵在大规模数据下极高的计算开销?

针对第一个挑战,本文揭示了分布内和分布外数据在特征空间中的两个重要的非线性模式,这两个非线性模式与它们的可分性密切相关,并且启发了我们设计出一个 Cosine-Gaussian 核。

针对第二个挑战,本文引入核近似技术,采用一个显式特征映射来近似核,从而避免了大规模数据场景下极大尺寸的核矩阵相关的存储和计算。我们直接在映射后的空间里进行主成分分析,显著降低计算复杂度。

3. 整体框架

3.1 面向分布外检测的非线性核的选择

我们分析 InD 和 OoD 数据在神经网络输出的特征,总结出两个关键非线性模式,并设计出一个面向 OoD 检测的 Cosine-Gaussian kernel。

第一,特征范数不平衡会干扰子空间学习。

我们观察到,神经网络 InD 和 OoD 数据提取出的特征的  norm 存在明显差异。这意味着,如果直接在原始特征空间中做 PCA,OoD 特征在用 InD 均值进行中心化时会产生较大偏移,导致投影和重构误差不稳定。

从 kernel 角度,一个 cosine kernel 对应的特征映射恰好可以做到特征范数的归一化,平衡 InD 和 OoD 的特征范数。因此,本文引入 cosine kernel,将特征归一化到单位球面:

这样可以削弱特征范数不平衡对检测的负面影响。

第二,归一化后的欧氏距离关系有助于区分 InD/OoD。

在 cosine-normalized 空间中,InD-InD 特征距离通常较小,而 InD-OoD 特征距离通常较大,这一距离差异有利于区分 InD 和 OoD 数据。我们用具有保留  距离特性的 MDS 降维技术可视化观察到,在基于保留  距离关系的降维后,InD 和 OoD 数据的可分性得到明显改善。

从 kernel 角度,一个 Gaussian kernel ()恰好具有保  距离的特性。因此,本文进一步使用 Gaussian kernel 建模这种距离结构。最终得到的复合核可以理解为:

也就是先用 cosine 归一化消除有害范数差异,再用 Gaussian kernel 捕获有益距离关系。

3.2 面向分布外检测的核近似

标准 KPCA 需要构造  的核矩阵,其中 N 为样本数目。在 ImageNet-1K 规模下,训练样本数超过 128 万,直接构造完整核矩阵几乎不可行。为此,本文使用显式映射近似 Cosine-Gaussian kernel,从而避免完整核矩阵的存储和计算。

本文探索了两类近似方法:

  1. Random Fourier Features, RFF 通过随机特征近似 Gaussian kernel。该方法数据无关,实现简单。
  2. Nystrom approximation 通过少量 landmark samples 构造低秩近似。该方法数据相关,更容易学习到适合当前 InD 数据的特征空间。

其中,针对 Nystrom approximation,本文提出面向分布外检测的 low-energy landmark 采样策略。普通 Nystrom 方法常使用均匀采样来选择 landmarks。但分布外检测的目标并不是单纯还原整个 kernel matrix,而是学习一个更能区分 InD/OoD 的子空间。因此,本文提出 low-energy sampling:优先选择神经网络对其不那么自信的 InD 训练样本作为 landmarks。这些低能量样本通常更靠近 InD 支撑集边界。用它们构造 Nystrom 近似,可以让 KPCA 重构误差对分布偏移更敏感,从而降低 OoD 被错误接受的概率。

3.3 探索面向分布外检测的可学习 kernel 表征

除了固定的非参数 Cosine-Gaussian kernel,本文还进一步讨论了 learnable kernel representation,包括核超参数优化和神经网络参数化映射。这说明了,本文框架并不局限于手工设计的 kernel,而可以扩展到数据驱动的 kernel learning。未来可以通过更合适的优化目标进一步提升非线性子空间对 InD/OoD 分布偏移的敏感性。


4. 详细方法

本文的 KPCA 检测方法可以划分为两个阶段。

阶段一(离线):非线性映射和子空间构造

给定一个在 InD 数据上训练好的分类网络 f,我们取其倒数第二层特征 z。在训练阶段,首先对 InD 训练样本提取特征,然后通过显式近似映射 Φ(z) 映射到非线性空间。

随后在 Φ(z) 空间中计算均值、协方差矩阵,并通过特征分解得到主成分矩阵 

其中,显式近似映射 Φ(z) 支持数据无关的 RFF 映射和数据相关的 Nystrom 近似。

阶段二(在线):计算重构误差

在测试阶段,对输入样本 

  1. 提取 DNN 特征 ,计算非线性映射 Φ(z)。
  2. 使用 InD 均值进行中心化,并投影到 KPCA 主成分子空间,计算重构误差。

检测分数为负重构误差:

本方法只需要在离线阶段遍历一次训练集、映射特征和降维,离线阶段结束时,只需要保存特征映射相关变量、投影矩阵和训练特征映射均值。在在线阶段,本方法只需要计算显式映射、投影到 KPCA 子空间并得到重构误差,不再需要遍历全部训练样本。

5. 实验结果

本文主要在 ImageNet-1K 大规模 OoD 检测基准上验证方法效果。InD 为 ImageNet-1K,OoD 数据集包括 iNaturalist、SUN、Places 和 Textures。实验模型包括 ResNet50、supervised contrastive learned ResNet50、MobileNetV2、ViT-B/16。对比方法覆盖 logits-based、gradient-based 和 feature-based 多类强基线。

本文还验证了 KPCA 与一系列 feature rectification 检测方法的兼容性。将 KPCA 与 ReAct 等特征裁剪策略结合后,检测性能可以进一步提升。这说明 KPCA 并不是一个孤立检测器,而可以作为一个子空间型检测模块,与已有特征修正技术组合使用。

整体结果显示,KPCA 框架取得了非常有竞争力的检测表现。并且,Nystrom 近似在多项设置下优于 RFF,说明数据相关的 Nystrom 近似更适合构造判别性非线性子空间。

本文从多个角度进行了消融分析,涵盖 kernel 选择、landmark 采样策略、特征层选择以及超参数敏感性分析等等,具体参见论文。


6. 总结与展望

本文提出了一个面向分布外检测的 KPCA 框架。其核心是通过 Cosine-Gaussian kernel 建模神经网络输出的数据特征中的关键非线性模式,再利用 RFF 和 Nystrom 近似实现大规模高效计算。本文的主要贡献可以总结为:

  1. 从非线性特征子空间角度理解 OoD 检测。
  2. 设计 Cosine-Gaussian kernel,描述与分布外检测相关的特征范数不平衡和特征距离关系模式。
  3. 使用 RFF 和 Nystrom 近似降低 KPCA 计算成本。并且,提出 low-energy landmark 采样策略,使 Nystrom 近似更适合 OoD 检测任务。
  4. 初步探索了面向分布外检测的可学习核特征技术。
  5. 在 ImageNet-1K 等大规模设置下取得强检测性能和低推理开销。

未来方向包括:引入辅助 outlier 数据、设计更直接面向分布偏移的训练目标,以及将非线性子空间检测推广到视觉以外的更多数据模态。

总体来看,本文展示了经典 kernel learning 与分布外检测结合的潜力:通过更合适的非线性表征,模型不仅能“分类”,也能更好地识别自己不应自信回答的输入。


开源代码:

  • https://github.com/fanghenshaometeor/ood-kernel-pca
  • https://github.com/fanghenshaometeor/ood-kernel-pca-ext

参考文献:

  • Kernel PCA for Out-of-Distribution Detection. NeurIPS 2024
  • Kernel PCA for Out-of-Distribution Detection: Non-Linear Kernel Selection and Approximation. IEEE TPAMI 2026

免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:AI安全这点事 AIForSecurity AIForSecurity《NeurIPS’24 & TPAMI’26 | 用 Kernel PCA 理解分布外检测:从非线性特征子空间到高效核近似》

大号【智安笔记】 网络安全文章

大号【智安笔记】

文章总结: 该文档为社交媒体推广内容,作者提醒读者关注其大号,无实质技术信息或可操作建议。 综合评分: 0 文章分类: 其他大号【智安笔记】 四季信安 2026
评论:0   参与:  0