ABOUT ME

-

Today
-
Yesterday
-
Total
-
  • AI를 공부해보자 #14. DNN Fingerprinting by General Examples
    Math/AI and Statistics 2026. 8. 28. 11:36

     

     

     

    Li & Xu의 Neurocomputing에 26년 발표된 논문 Deep neural network fingerprinting by general examples을 정리했다.

    Introduction

    DNN은 학습 단계에서 사용하지 않은 데이터를 입력하더라도 특정 class를 매우 높은 confidence로 예측하는 경우가 있다. 이 논문에서는 이러한 입력을 ‘General Example’이라고 부른다. 이 연구는 training data 밖에서는 모델이 일반화하는 방식이 모델마다 다를 것이라는 가설을 바탕으로, 모델의 general example을 해당 모델의 fingerprint로 사용할 수 있는지를 검증한다.

     

    특히, 이 논문은 기존 decision-boundary/adversarial-example 기반 fingerprinting fingerprint robustness uniqueness 사이의 균형을 맞추기 위해 모델·데이터셋별 parameter tuning이 필요하고 모델 수정에 민감하다는 한계를 가진다고 보았다. , 같은 모델 사이는 가깝게 측정되고 다른 모델 사이는 구분되게 측정되도록 fingerprint를 남기기 위해 parameter를 적절히 조정해주는 과정이 robust한 모델을 구분하는 시스템을 만들기 적절하지 않다고 지적하였다.

     

    이후 training data에 존재하지 않지만 특정 모델이 높은 confidence로 분류하는 general example fingerprint로 이용하는 방법을 새롭게 제안하여, CIFAR-10·CIFAR-100·ImageNet 및 서로 다른 DNN architecture model modification 조건에서의 ownership verification 실험을 통해, 독립 모델을 구별하면서도 파생·변형 모델에서는 fingerprint가 잘 유지되는 더 robust하고 효율적인 model fingerprinting을 달성했다고 주장하였다.

     

     

    Threat Model

    모델 소유자는 자신의 dataset으로 custom DNN을 설계하여 cloud service 형태로 제공한다. 이러한 원본 모델을 $f_V$라 정의한다. 공격자는 모델 획득 후 수정을 거쳐 불법 재배포하여 자신의 서비스인 것처럼 사용할 수 있다. 이러한 행위가 일어났음이 의심되는 모델을 $f_S$라 정의한다. 모델 $f_V$의 소유자는 의심 모델의 파라미터에 접근할 수 없고, $f_S$ prediction API에만 접근할 수 있는 black-box 환경이다. 검증을 위해 fingerprint를 만드는 과정에서 원본 모델 $f_V$는 white-box로 접근할 수 있다고 가정한다.

     

     

     

    The Proposed Method

    Fingerprinting generation

    저자들은 다음과 같이 세 종류로 general example을 분류한다.

     

    Type-I: Correctly classified meaningful data, represents model’s intended performance.

    Type-II: Misclassified data, such as adversarial examples.

    Type-III: Meaningless data, such as noise with high classification probability for certain classes.

     

    이 연구에서는 Type-II general example을 사용하여 fingerprint를 구성하였다.

     

    Fingerprint를 구성하는 과정은 다음과 같다.

    • Step1. 정상 이미지 선택: DNN 모델 학습 과정에서 사용한 train dataset에서 이미지를 선택한다. 이때, ground-truth label은 중요하지 않으며, 대신 DNN이 특정 class에 큰 confidence(논문의 구현에서는 0.999 이상)를 가지는 이미지를 선정한다.
    • Step 2. Target Class 선택: DNN이 큰 confidence를 가지는 class가 아닌 새로운 target class를 선택한다.
    • Step 3. 이미지 최적화: 모델 파라미터를 고정하고, adversarial example를 생성하듯 perturbation을 추가한다. 이때, adversarial attack과는 달리 perturbation의 크기 제약이 없다. 사람이 봤을 때 원본 이미지와 비슷할 필요 없이 그저 target class에 대하여 강한 confidence를 가지도록 하게 한다. 
    • Step 4. 위의 과정을 반복하여 여러 이미지-target class 쌍으로 fingerprint set을 구성한다. 구현에서는 100개의 쌍으로 구성하였다.

     

    최적화 식은 다음과 같다. 

     

    이때  $x$는 초기 정상 이미지, $i$는 DNN이 해당 이미지를 분류한 class (gound-truth class와 달라도 됨), $j$는 target class, $span$는 $i$와 다른 클래스 간 confidence 차이의 최댓값, $\gamma$는 confidence threshold (이 논문의 구현에서는 0.999)이다. 

    이러한 loss function을 통해 perturbation은 이미지를 target class로 유도하는 동시에 원래 class까지의 거리보다 다른 모든 class까지의 거리가 크게 유도한다. , target class $j$ 가 단순히 top-1인 수준이 아니고 다른 모든 class와 차이가 $span$ 이상이 되도록 하여, 최종 이미지가 decision boundary 근처가 아닌 target decision region의 깊은 곳으로 가게 한다.

     

    Fingerprint verification

    모델 소유자는 $f_V$에서 만든 fingerprint 입력을 그대로 $f_S$ API에 입력한다. 그리고 top-1 class를 반환받아 일치율을 확인하여 검증한다. 

     

    Experiment

    원본 모델 $f_V$와 dataset으로, GoogLeNet/CIFAR-10, ResNet-34/CIFAR-100, VGG-11/ImageNet의 조합을 선택하였다.

    의심 모델 $f_S$는 동일한 dataset에 대해 동일하거나 다른 모델 구조로 새로 학습한 independent 모델과 원본 모델을 수정한 derived 모델로 구분하였다. Independent 모델은 원본 모델과 관계가 없고 general example이 정말 개별 모델 고유의 fingerprint인지 검증하기 위한 대조군이다. Derived model weight pruning, quantization, fine-tuning, retraining의 방법으로 원본 모델에 추가 학습을 하여 구성한 모델을 의미한다.

     

    Independent 모델간 일치율(Table 5) derived 모델간 일치율 (Table 11)

     

    논문은 크게 다음과 같은 실험적 결론을 내린다. 첫 번째, independent 모델에서는 낮은 일치율을 보인다. 특히, 같은 dataset에 같은 구조 모델을 사용했더라도 독립적으로 학습되었다면 다른 구조 모델을 사용한 것과 마찬가지로 낮은 일치율을 보인다. 두 번째, derived 모델에서는 높은 일치율을 보인다. Table 11에서 확인할 수 있듯, 0.98 이상의 일치율이 일관되게 나타난다.

    댓글

Designed by Tistory.