Forensic_Self-Descriptions
约 2700 字大约 9 分钟
2026-04-08
Forensic Self-Descriptions Are All You Need for Zero-Shot Detection, Open-Set Source Attribution, and Clustering of AI-generated Images
Tai D. Nguyen, Aref Azizpour, Matthew C. Stamm Drexel University
摘要
基于先进人工智能工具生成逼真图像的出现,给法医检测和来源归因带来了重大挑战,尤其是在新型生成技术快速涌现的背景下。传统方法往往因依赖训练过程中已知来源的特定特征,导致难以泛化到未见过的生成器。为解决这一问题,我们提出了一种创新方法,通过显式建模法捕捉法医图像的微观结构特征——即图像生成过程中特有的细微像素级模式。仅使用真实图像进行自监督学习,我们训练出一套多样化的预测滤波器,用于提取能捕捉这些微观结构不同特征的残差。通过跨尺度联合建模这些残差特征,我们构建了一个紧凑模型,其参数构成每张图像独特的法医自描述特征。这种自描述特征使我们能够实现合成图像的零样本检测、开放集图像来源归因以及无需先验知识的来源聚类分析。大量实验表明,相较于现有技术,我们的方法在准确性和适应性方面表现更优,推动了合成媒体取证领域的技术进步。
1.引言
人工智能生成图像质量的快速提升使得合成图像与真实图像的区分度日益降低[26,68]。尽管传统检测方法可通过训练识别此类图像,但其对新生成器或未见过生成器所产内容的泛化能力仍存在局限。随着新型生成模型的快速涌现,亟需开发能够在无预先曝光条件下可靠识别新型图像源的检测方法[40,55]。 传统合成图像检测与源识别方法通常依赖于学习能够区分真实图像与合成图像、或区分真实图像与特定合成源的嵌入表示[14,29,46,65,70]。虽然这些方法对训练数据中相似的源类型有效,但往往难以适应新型生成模型[19,54]。究其原因,其目标函数设计容易导致模型仅学习到可用于区分训练数据中已知源特征的参数。因此,这些方法常会忽略那些对识别新生成器输出图像至关重要的特征信息。

图1. 我们从每幅图像中提取法医显微结构的自描述特征,并利用这些特征准确完成多种具有挑战性的任务,包括:零样本检测、开放集源属性推断以及图像源的无监督聚类分析。
为解决这一问题,我们提出了一种替代方案(如图1所示,详见图3),该方案在检测合成图像及其来源归属方面兼具更高效率与通用性。不同于传统判别性嵌入空间学习方法,我们专注于显式建模图像中嵌入的法医微结构特征。学界已明确证实,无论是真实相机拍摄图像还是合成图像生成器,都会以统计微结构形式留下独特法医痕迹——这些微妙的像素级关联可作为识别特征[45,47,73,74]。为从图像内容中分离这些微结构特征,我们仅基于真实图像数据采用自监督学习流程,通过训练多样化预测滤波器集来近似场景内容特征。通过应用这些滤波器,我们获得了多个不同的残差值,每个残差值均捕捉了法医显微结构的不同特征。我们随后采用紧凑型参数模型对这些残差进行多尺度联合建模,该模型的参数构成每幅图像独特的法医特征自描述。这种特征描述有效封装了图像的内在法医属性,使我们能够完成多项具有挑战性的任务:(1)对合成图像进行零样本检测;(2)以开放集方式将图像归因于其源生成器;(3)在无需预先了解生成器信息的情况下,基于图像来源进行聚类分析。 通过大量实验与消融研究,我们证实该方法在零样本检测、开放集源属性推断及聚类任务中均能实现高准确率,其鲁棒性与适应性始终优于现有竞争技术。 我们的主要贡献总结如下: 1.我们提出法医自描述技术,用于捕捉图像中法医微结构的内在特征。基于这些特征描述,我们能够精准完成合成图像检测与来源归因等关键任务。 2.实验证明,该技术无需接触样本即可实现零样本合成图像检测。 3.法医自描述技术在开放集归因分析和聚类任务中表现优异,可实现未知生成器来源的精准识别与图像分类。 4.通过全面实验验证,我们的方法在真实与合成数据源场景中均展现出卓越的鲁棒性与泛化能力。
2.背景与相关工作
真实AI生成图像的兴起对检测与来源归因提出了重大挑战,这推动了监督学习、开放集学习及零样本学习方法的发展。
法医显微结构 已有充分证据表明,生成器神经架构中的不同设计选择会诱导人工智能生成图像中出现特定的统计学显微结构[19,68,73]。基于这一优势,研究人员最初通过手工制作滤波器或构建显式数学模型来提取这些微观结构,用于检测合成图像[7,18,20,43,51]。然而,近期研究方法常采用卷积神经网络(CNN)从数据中学习这些模型,从而实现更通用的检测系统。
监督学习方法 用于检测合成图像的监督学习方法[5,13,47,65,70,72]通常基于二元标注数据集进行模型训练。尽管这些方法在训练集相似数据源上表现良好,但先前研究显示其对未见过的生成模型图像存在识别困难[19,54]。这是因为其学习到的特征仅适用于训练数据,可能无法捕捉新生成器特有的伪影特征[40,55]。
开放集源属性识别 为解决监督方法的局限性,研究者近期尝试将其他计算机视觉领域开发的开放集识别技术[10,16,39,52,76]应用于合成图像源属性识别。代表性研究包括POSE[71]、Fang等人[28]及Abady等人[1]。虽然这些方法比监督方法具有更好的泛化能力,但仍高度依赖已知数据源学习到的特征表示,可能难以有效泛化到未知数据源。
零样本检测 最新研究开发了无需接触特定生成模型即可检测合成图像的方法。这些方法通常依赖真实图像与合成图像之间存在的非特征性差异。例如,部分方法[22,59]采用自编码器(如扩散模型、图像压缩网络)进行重构误差分析,而其他方法[54,63]则利用CLIP嵌入来检测通用视觉特征中的不一致性。仅有少数研究[66,67]采用有限的法医特征集进行广义检测。
尽管前景广阔,但正如我们后续研究所示,这些零样本方法往往会产生不稳定的表现,其结果会因基准测试所用真实数据集与合成数据集的配对方式而异。这种差异性源于非法医特征可能受数据集特定内容特征的影响。此外,随着生成技术的持续改进与演进,这些特征的有效性也无法得到保证。
无监督聚类 针对合成图像开展此类任务的研究仍处于探索阶段。Girish等人[31]提出了一种通过简单卷积神经网络(CNN)对嵌入向量进行过聚类分析来发现新型生成对抗网络(GAN)生成器的方法。Yang等人[71]则提出了一种可应用于聚类分析的新型开放集方法。总体而言,在缺乏任何监督信息的情况下,基于图像源特征实现精准聚类仍面临重大挑战。
3.提出方法
本文提出了一种无需接触合成图像即可实现检测与属性识别的创新方法。

图3. 我们的方法能够在无需预先了解图像来源的情况下检测并归因合成图像。具体实现方式是从单张图像中提取包含法医微结构特征的残差,并将其跨尺度联合建模为法医自描述特征。
如图3所示,我们首先仅使用真实图像训练一组多样化的预测滤波器来近似场景内容,随后应用这些滤波器从单张图像中提取包含法医微结构特征的残差数据。最后通过参数化模型对多尺度残差数据进行联合建模,为每张图像生成独特的法医自描述特征。该自描述特征能够捕捉图像的内在法医属性,从而实现图像来源的精准区分。具体实现细节如下所述。
3.1.法医学显微结构提取
先前研究表明,图像生成过程中会留下独特的法医微结构特征[47]。这一现象在传统相机与人工智能图像生成器中均存在[45,73]。虽然利用微结构差异来识别合成图像是一种常见策略[66,67],但这些特征无法直接观测。 不过我们可通过以下方法进行估算:首先将图像I建模为两个独立分量的叠加——场景内容S与法医微结构 Ψ ,其数学表达式为:
