Bibliothèque / fiche n°13
Mind the Rift: Cross-Scale Coupling Mismatch for AI-Generated Video Detection
L'article présente RIFT, une méthode qui détecte les vidéos générées par IA en mesurant le défaut de couplage entre la dynamique sémantique globale (macro) et les résidus de pixels (micro). Elle atteint un F1-score de 99,33 % sur VidProM et de 99,72 % sur GenVidBench.
Problème
La détection de vidéos générées par IA en exploitant la relation de couplage entre la dynamique temporelle macro et les résidus micro, un signal forensique ignoré par les approches existantes qui analysent chaque échelle de manière isolée.
Contributions
- Identification du défaut de couplage multi-échelle (cross-scale coupling mismatch) comme un signal forensique robuste et indépendant du générateur.
- Proposition de RIFT, un framework exploitant une décomposition orthogonale de Gram-Schmidt pour analyser séparément la géométrie/topologie des trajectoires (macro) et les résidus stéganalytiques (micro).
- Démonstration empirique de l'agnosticisme de la méthode vis-à-vis de l'encodeur utilisé pour l'extraction de caractéristiques.
Méthode
RIFT extrait des caractéristiques de vidéos via des encodeurs gelés et les projette dans deux sous-espaces orthogonaux (macro et micro) grâce à une contrainte de Gram-Schmidt. Le flux macro modélise la trajectoire temporelle sur une variété géométrique et calcule des invariants topologiques via l'homologie persistante. Le flux micro extrait les résidus de bruit de pixel à l'aide de filtres stéganalytiques et de convolutions de Bayar. Enfin, un module de divergence estime la dépendance conditionnelle P(micro|macro) pour quantifier le défaut de couplage propre aux vidéos générées par IA.
- Architecture
- Backbones gelés (DINOv2 ViT-S/14 et RAFT-Large), projecteurs MLP avec contrainte d'orthogonalité Gram-Schmidt, régularisation de variété (pertes d'isométrie, de lissage et InfoNCE), descripteurs de géométrie différentielle (courbure de Menger, torsion, vitesse, accélération, jerk) traités par un Transformer, homologie persistante (paysages de persistance H0/H1), filtres SRM et Bayar suivis d'un CNN+BiGRU pour le micro, réseau MINE pour l'information mutuelle, fusion par portes apprises et classifieur MLP final.
- Nouveauté
- L'utilisation de la divergence de couplage multi-échelle P(micro|macro) comme signal forensique principal, garantie par une décomposition orthogonale stricte, combinée à l'application de l'homologie persistante sur les trajectoires temporelles de vidéos.
- Indices exploités
- spatialtemporelfréquentielmouvementautre
Évaluation
Entraînement et test sur des splits stratifiés 50/50 de VidProM et GenVidBench. Évaluation de la généralisation cross-générateur via un protocole Leave-One-Generator-Out (LOGO) sur VidProM, et test zero-shot sur le générateur commercial Seedance 2.0.
| Dataset | Usage | Détails |
|---|---|---|
| VidProM | les deux | 120K vidéos au total, comprenant 50K vidéos réelles de DVSC2023 et 70K vidéos générées par 7 générateurs de VidProM. |
| GenVidBench | les deux | 68K vidéos au total, couvrant 4 générateurs différents avec des sous-ensembles Main et Plants. |
- Générateurs non vus testés
- oui
- Ablations
- oui
- Robustesse testée
- compression H.264, compression H.265, bruit gaussien, recadrage spatial (cropping)
- Générateurs couverts
- Pika, VideoCrafter2, Text2Video-Zero, ModelScope, CogVideo, OpenSora, Show-1, Mora, MuseV, SVD, Seedance 2.0
- Métriques
- ACC, Precision, Recall, F1, AUC
- Baselines
- CNNDetection, UnivFD, FreDect, Gram-Net, TALL, STIL, DeMamba, ReStraV, NSG-VD, MPF-Net
Résultats
Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 6 · ≈ valeur retrouvée seule : 0 · introuvable : 0
| Méthode | Dataset | Métrique | Valeur | Réglage | |
|---|---|---|---|---|---|
| citation retrouvée | RIFT proposée | VidProM | F1 | 99.33 | Moyenne sur 7 générateurs, split 50/50extrait citéRIFT achieves 99.33% and 99.72% F1-score respectively |
| citation retrouvée | RIFT proposée | GenVidBench | F1 | 99.72 | Moyenne sur 4 générateurs, split 50/50extrait citéRIFT achieves 99.33% and 99.72% F1-score respectively |
| citation retrouvée | ReStraV | VidProM | F1 | 97.83 | Baseline, split 50/50extrait citéReStraV [20]: 97.83% F1 on VidProM |
| citation retrouvée | MPF-Net | GenVidBench | F1 | 97.03 | Baseline, split 50/50extrait citéMPF-Net [17]: 97.03% F1 on GenVidBench |
| citation retrouvée | RIFT proposée | VidProM | AUC | 99.96 | Moyenne sur 7 générateurs, split 50/50extrait cité99.22 99.33 99.96 99.56 99.72 99.96 |
| citation retrouvée | RIFT proposée | VidProM | ACC | 99.22 | Moyenne sur 7 générateurs, split 50/50extrait cité99.22 99.33 99.96 99.56 99.72 99.96 |
Gain
RIFT surpasse la meilleure baseline de 1,50 point de pourcentage en F1-score sur VidProM (par rapport à ReStraV) et de 2,69 points de pourcentage sur GenVidBench (par rapport à MPF-Net).
99.33% F1 on VidProM with 7 generators (+1.50 pp over ReStraV) and 99.72% F1 on GenVidBench (+2.69 pp over MPF-Net)citation retrouvée
Jugement du relecteur
Points forts
- Excellente performance de généralisation cross-générateur validée par un protocole LOGO rigoureux (97,87 % en moyenne).
- Démonstration convaincante de l'agnosticisme vis-à-vis de l'encodeur (DINOv1 vs DINOv2, mise à l'échelle des paramètres).
- Validation expérimentale directe de l'hypothèse de couplage via l'analyse de l'information mutuelle et de la perte conditionnelle.
- Test zero-shot réussi à 100 % sur un générateur commercial récent (Seedance 2.0).
Faiblesses
- Forte sensibilité au recadrage spatial (cropping), ce qui limite l'utilisation pratique sur des vidéos éditées.
- L'évaluation de la robustesse aux perturbations est restreinte à un très petit sous-ensemble de 996 vidéos et montre des résultats non monotones.
- Le coût de calcul du flux macro (Transformer) est élevé, représentant 86 % du temps de calcul post-backbone.
Menaces à la validité
- L'estimateur MINE produit des valeurs d'information mutuelle négatives pour les vidéos générées, révélant une instabilité de l'estimation variationnelle hors-domaine.
- L'utilisation de caractéristiques précalculées et gelées (DINOv2, RAFT) pourrait masquer des limites d'adaptation face à de futurs générateurs dont les distributions s'écartent radicalement de ces représentations.
Reproductibilité
Le code source, les modèles pré-entraînés et des vidéos de démonstration sont disponibles sur GitHub (https://github.com/Litsay/RIFT). Les hyperparamètres détaillés et les configurations de perte sont fournis dans l'annexe A.
Limites déclarées par les auteurs
- fragility under aggressive spatial cropping, which alters the spatial context on which patch statistics and optical flow are computed
- The macro Transformer accounts for 86% of post-backbone compute
- broader evaluation on next-generation architectures beyond the Seedance 2.0 case study
Affirmations clés et leurs preuves
Le défaut de couplage multi-échelle est un signal forensique robuste et indépendant du générateur.
We identify cross-scale coupling mismatch as a new forensic signal, where scale refers to the level of abstractioncitation retrouvée
RIFT obtient des performances de pointe sur les benchmarks récents.
RIFT achieves 99.33% and 99.72% F1-score respectively, with 97.87% unseen-generator detection rate in leave-one-out evaluationcitation retrouvée
La détection repose sur la conception du framework et non sur les spécificités de l'encodeur.
switching to a different encoder family (DINOv1) reduces F1 by only 0.73 pp.citation retrouvée
Pour ton PFE
Ce travail peut servir de baseline de pointe. Le mécanisme d'orthogonalisation de Gram-Schmidt et le module de divergence de couplage P(micro|macro) peuvent être réutilisés pour concevoir des architectures multi-flux non redondantes. Les caractéristiques précalculées et le protocole d'évaluation sur VidProM/GenVidBench fournissent un cadre d'expérimentation prêt à l'emploi.
Pistes de contribution
Amélioration de la robustesse au recadrage spatial par augmentation de données difficulté moyenne
L'article note une fragilité au cropping car il altère le contexte spatial des patchs et du flux optique.
Premier pas. Introduire des transformations de recadrage aléatoire (random cropping) et de redimensionnement lors de l'extraction des caractéristiques ou appliquer une augmentation de données spatiale directement dans le projecteur micro.
Distillation de connaissances du flux macro pour réduire la latence difficulté moyenne
Le Transformer du flux macro représente 86 % du temps de calcul post-backbone (40.4 ms).
Premier pas. Distiller les représentations géométriques et topologiques du Transformer macro vers un réseau de neurones feed-forward ou un MLP temporel plus léger.
Stabilisation de l'estimateur d'information mutuelle (MINE) difficulté élevée
L'estimateur MINE produit des valeurs négatives instables pour les vidéos générées en raison de la borne variationnelle lâche.
Premier pas. Remplacer MINE par un estimateur d'information mutuelle plus stable ou utiliser une divergence de Jensen-Shannon régularisée.