673Identifiées −38 doublons 635Uniques −364 exclues 110Retenues au tri 103 à lire 7Lues 7 à décider 0Incluses

Bibliothèque / fiche n°488

Data Diversity, Not Frequency Invariance: A Controlled and Self-Audited Study of Compression-Robust Deepfake Detection

Aliyev et RustamovarXiv2026 analysé 5/5

Résultat principal
0.9224AUC · FaceForensics++ test
Solidité de l'évaluation
5/5jugée par le relecteur
Générateurs non vus
ouitest de généralisation
Datasets
FaceForensics++, FaceShifter, Celeb-DF v2, DFD (DeepFakeDetection)
Chiffres vérifiés dans le PDF
6/6code disponible

Cet article étudie la robustesse des détecteurs de deepfakes face à la compression vidéo à travers le modèle CAFRL combinant des flux fréquentiels et une invariance par adversarialité. Les auteurs démontrent via une étude contrôlée que l'amélioration de la robustesse provient de la diversité des données d'entraînement plutôt que des représentations invariantes en fréquence.

Problème

Le verrou scientifique attaqué est la perte drastique de performance (5 à 15 points d'AUC) subie par les détecteurs de deepfakes face à la compression vidéo H.264 (notamment aux facteurs de taux de compression élevés comme c40), que l'état de l'art tente de résoudre par des caractéristiques fréquentielles et une apprentissage d'invariance par adversarialité.

Contributions

  • C1 - une étude négative contrôlée et auditée montrant que les flux block-DCT et FFT-phase n'apportent pas de valeur ajoutée par rapport à un backbone spatial seul, et que l'adversaire de compression dégrade son propre estimateur.
  • C2 - la démonstration constructive que la diversité des données d'entraînement est le levier dominant pour la robustesse au re-encodage H.264 par rapport à l'augmentation synthétique JPEG.
  • C3 - un protocole rigoureux basé sur des barrières d'arrêt pré-enregistrées (STOP-gates) et un auto-audit du résultat négatif.
  • C4 - des benchmarks harmonisés évaluant plusieurs détecteurs sur des balayages de compression au niveau vidéo.

Méthode

Le modèle CAFRL intègre trois flux parallèles : un flux spatial basé sur un backbone pré-entraîné, un flux block-DCT 8x8 sur le canal de luminance, et un flux FFT-phase utilisant les composantes sin/cos. Un estimateur de compression prédit le niveau de CRF pour conditionner un mécanisme d'attention par bande (style FiLM). Enfin, un discriminateur normalisé spectralement, relié par une couche de réversion de gradient (GRL), force l'invariance à la compression sur la représentation fréquentielle.

Architecture
Backbone spatial EfficientNet-B0 pré-entraîné sur ImageNet, petits CNN pour les flux block-DCT et FFT-phase, un estimateur de compression ordinal (1.37M paramètres), un discriminateur de compression (1.32M paramètres) avec GRL, et une fusion par attention inter-modale (CMAM).
Nouveauté
L'association hybride de flux block-DCT et FFT-phase conditionnés par un estimateur de niveau de compression ordinal via FiLM, couplée à un apprentissage d'invariance par adversarialité sur des vidéos H.264.
Indices exploités
spatialfréquentielmouvement

Évaluation

Entraînement multi-qualité mélangeant six niveaux de CRF par batch d'époque sur FaceForensics++, avec validation sur le jeu de validation officiel FF++ à c23 et c40, et tests intra-dataset, inter-dataset et sur manipulations non vues.

DatasetUsageDétails
FaceForensics++les deuxQuatre méthodes de manipulation principales (Deepfakes, Face2Face, FaceSwap, NeuralTextures), divisions officielles train/val/test, avec des ré-encodages H.264 à CRF {0, 23, 28, 32, 36, 40}.
FaceShiftertestUtilisé entièrement comme sonde pour les manipulations non vues (unseen-manipulation probe).
Celeb-DF v2testJeu de données croisé pour l'évaluation hors domaine (out-of-distribution).
DFD (DeepFakeDetection)testJeu de données proche du domaine (near-domain) aux niveaux c23 et c40.
Générateurs non vus testés
oui
Ablations
oui
Robustesse testée
compression H.264 CRF {28, 32, 36, 40}, augmentation JPEG synthétique
Générateurs couverts
Deepfakes, Face2Face, FaceSwap, NeuralTextures, FaceShifter
Métriques
AUC, ACC, AP, F1
Baselines
Xception, F3-Net, FreqNet, SpatialBase

Résultats

Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 4 · ≈ valeur retrouvée seule : 2 · introuvable : 0

MéthodeDatasetMétriqueValeurRéglage
citation retrouvée CAFRL as specified proposée FaceForensics++ testAUC0.9224 niveau c40, graine 42
extrait citévideo-AUC .9590 vs .9224 at c40, both at seed 42, a paired ∆of +0.0366
citation retrouvée SpatialBase (EffNet-B0) FaceForensics++ testAUC0.9590 niveau c40, graine 42
extrait citévideo-AUC .9590 vs .9224 at c40, both at seed 42, a paired ∆of +0.0366
≈valeur retrouvée Fair-N proposée FaceForensics++ testAUC0.9586 niveau c40, comparé à SpatialBase (0.9590)
extrait citéFair-N: c40 0.9586 vs SpatialBase 0.9590 — ∆= −0.0004
≈valeur retrouvée Fair-W proposée FaceForensics++ testAUC0.9645 niveau c40, comparé à SpatialBase (0.9590)
extrait citéFair-W (frequency at full strength): c40 0.9645 vs SpatialBase 0.9590 — ∆= +0.0056
citation retrouvée Xception (synth. JPEG training) FaceForensics++ testAUC0.890 au niveau c40 réel, entraînement par augmentation JPEG synthétique
extrait citéTraining with synthetic JPEG-quality augmentation — the common shortcut — reaches only 0.890 [0.861, 0.916] at real H.264 c40
citation retrouvée Xception (real-CRF training) FaceForensics++ testAUC0.963 au niveau c40 réel, entraînement sur variants CRF réels
extrait citéwhere identical training on real CRF variants reaches 0.963 [0.948, 0.976]

Gain

L'entraînement sur des variants CRF réels surpasse l'augmentation synthétique JPEG de 7.3 points d'AUC au niveau c40 réel.

training on real H.264 CRF variants beats the common synthetic JPEG-augmentation shortcut by +7.3 AUC points at real c40 citation retrouvée

Jugement du relecteur

Points forts

  • Protocole expérimental extrêmement rigoureux avec pré-enregistrement des règles de décision et des STOP-gates.
  • Auto-audit approfondi des résultats négatifs permettant d'identifier des défauts de conception et d'entraînement (recette vs architecture).
  • Comparaisons contrôlées par rapport à la capacité, l'augmentation et la recette d'optimisation.
  • Mise à disposition complète du code, des métadonnées de recadrage et des prédictions par vidéo.

Faiblesses

  • Évaluation limitée à une seule famille de datasets (FaceForensics++) pour l'essentiel des conclusions.
  • Absence de test sur des générateurs récents de type diffusion (Sora, SVD, etc.) malgré leur mention dans l'introduction.
  • La branche adversariale n'a pas été testée sous la recette équitable (fair recipe).

Menaces à la validité

  • Utilisation de trois graines aléatoires pour les variantes équitables, ce qui limite la certitude statistique globale (résolution de l'ordre de 1.5-1.7 points à travers les graines).
  • Suppression des cultures faciales (crops) après la campagne, nécessitant la réobtention des corpus et la régénération pour certains analyses non persistées.

Reproductibilité

Excellente : code source disponible sur GitHub, dépôt archivé sur Zenodo avec les checkpoints, les métadonnées de recadrage, les scripts de pipeline et les listes de division.

Limites déclarées par les auteurs

  • L'entraînement et l'évaluation intra-dataset se limitent à la famille FaceForensics++.
  • La fréquence est testée via une seule instantiation (block-DCT 8x8 et FFT-phase).
  • La recette équitable (fair recipe) n'a pas inclus de recherche d'hyperparamètres du côté fréquentiel et l'adversaire y est non testé.
  • Le codec testé est uniquement le H.264 (pas de H.265, AV1, ou chaînes de transcodage de plateformes).
  • L'étude utilise un CNN de 4M paramètres de 2019, les modèles de type foundation-model ne sont pas testés.
  • Toutes les manipulations proviennent des ères GAN ou graphiques (pas de vidéos générées par diffusion).

Affirmations clés et leurs preuves

Le déficit de performance initial de CAFRL était un artefact de recette d'entraînement et non un échec architectural.

the STOP-gate’s +3.66 pt deficit at c40 proved to be a recipe artifact: CAFRL’s own components at the baseline’s training recipe recovered +3.96 pt citation retrouvée

La robustesse au re-encodage H.264 CRF à passe unique est obtenue grâce à la diversité des données d'entraînement.

robustness under single-pass H.264 CRF re-encoding is bought by data diversity: real constant-rate-factor variants beat synthetic JPEG augmentation by 7.3 points non retrouvé

Pour ton PFE

Ce travail est une méthodologie idéale pour structurer un PFE rigoureux : il démontre comment déjouer les pièges des fausses attributions d'architecture grâce à des contrôles stricts de la recette d'entraînement et des données. Le code open-source et les protocoles de pré-enregistrement servent de modèle pour évaluer méthodiquement un module de deeplearning.

Pistes de contribution

Évaluation sur des générateurs vidéo récents (Diffusion-based models) difficulté élevée

L'article se limite à des manipulations de l'ère GAN/graphiques (FaceForensics++) et ne teste pas les générateurs modernes basés sur la diffusion mentionnés dans l'introduction.

Premier pas. Reprendre le pipeline de l'article en constituant un benchmark multi-compression à partir de datasets de vidéos générées par diffusion (ex: Sora, SVD, Pika).

Extension de la robustesse à de nouveaux codecs (H.265, AV1) difficulté moyenne

L'article évalue uniquement le re-encodage H.264 CRF à passe unique, laissant de côté les codecs modernes et les chaînes de compression multi-passes.

Premier pas. Modifier le pipeline FFmpeg pour générer un ladder de compression multi-codec (H.265, AV1) et tester si la diversité des codecs surpasse la diversité de taux de compression.

Investigation de l'apport des trunks de type Foundation Models difficulté moyenne

L'étude se restreint à un CNN de petite taille (4.0M paramètres), ignorant si les conclusions sur la redondance fréquentielle s'appliquent aux grands modèles visuels gelés (CLIP / ViT).

Premier pas. Remplacer l'EfficientNet-B0 par un backbone de type CLIP ou Video-MAE gelé avec des adaptateurs légers, et reproduire les tests de redondance fréquentielle.