Bibliothèque / fiche n°44
DeMamba: AI-generated video detection on million-scale GenVideo benchmark
- Solidité de l'évaluation
- 4/5jugée par le relecteur
- Générateurs non vus
- ouitest de généralisation
- Datasets
- GenVideo
- Chiffres vérifiés dans le PDF
- 0/4code disponible
Cet article introduit GenVideo, un dataset à grande échelle pour la détection de vidéos générées par IA, et propose DeMamba, un module plug-and-play basé sur Mamba pour modéliser les incohérences spatio-temporelles. Les expériences démontrent des performances de généralisation et de robustesse supérieures face aux baselines existantes.
Problème
Les méthodes actuelles de détection d'images ne modélisent pas les incohérences temporelles, tandis que les méthodes de détection vidéo peinent à modéliser efficacement les incohérences spatiales locales, ce qui limite leur généralisation.
Contributions
- Introduction du premier dataset à grande échelle pour la détection de vidéos générées par IA, nommé GenVideo.
- Conception de deux tâches d'évaluation : la classification vidéo inter-générateur et la classification vidéo dégradée.
- Proposition d'un module plug-and-play nommé Detail Mamba (DeMamba) pour modéliser les incohérences spatio-temporelles.
Méthode
Le module DeMamba s'intègre à un extracteur de caractéristiques visuelles pour analyser les incohérences spatiales et temporelles. Les caractéristiques des frames vidéo sont divisées en zones spatiales par consolidation spatiale. Une stratégie de balayage continu (continuous scan) est appliquée sur chaque région segmentée pour préserver la continuité spatiale et capturer les dynamiques temporelles via un bloc S6 (Mamba). Enfin, les caractéristiques globales et locales issues du module sont agrégées et transmises à une tête de classification MLP.
- Architecture
- Backbone (CLIP ou XCLIP), module plug-and-play Detail Mamba (basé sur le mécanisme S6), et une tête de classification MLP avec fonction de perte binary cross-entropy.
- Nouveauté
- L'utilisation d'un modèle d'espace d'états structuré (Mamba) adapté aux dimensions spatio-temporelles via une stratégie de balayage continu (continuous scan) pour détecter des vidéos générées par IA.
- Indices exploités
- spatialtemporel
Évaluation
Entraînement sur un ensemble de base (many-to-many ou one-to-many) et test sur un ensemble hors domaine (Dv-ood) comprenant des générateurs non vus ou des vidéos dégradées.
| Dataset | Usage | Détails |
|---|---|---|
| GenVideo | les deux | 2 314 182 vidéos au total (2 294 594 pour l'entraînement et 19 588 pour le test), combinant des vidéos réelles et des vidéos générées par diverses méthodes. |
- Générateurs non vus testés
- oui
- Ablations
- oui
- Robustesse testée
- H.264 compression, JPEG compression, FLIP, Crop, text watermark, image watermark, Gaussian noise, color transform
- Générateurs couverts
- Sora, Pika, SVD, Gen2, VideoCrafter, DynamiCrafter, SEINE, Latte, OpenSora, ModelScope, ZeroScope, I2VGen-XL
- Métriques
- AUC, ACC, AP, F1
- Baselines
- F3Net, NPR, STIL, VideoMAE-B, MINTIME-CLIP-B, FTCN-CLIP-B, TALL, CLIP-B-PT, CLIP-B-FT, XCLIP-B-PT, XCLIP-B-FT
Résultats
Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 0 · ≈ valeur retrouvée seule : 0 · introuvable : 4
| Méthode | Dataset | Métrique | Valeur | Réglage | |
|---|---|---|---|---|---|
| non retrouvé | XCLIP-B-FT | GenVideo | AP | 86.77 | many-to-many generalization task, average on Dv-oodextrait citéXCLIP-B-FT | Video | AP | 0.8677 |
| non retrouvé | DeMamba-XCLIP-FT proposée | GenVideo | AP | 97.10 | many-to-many generalization task, average on Dv-oodextrait citéDeMamba-XCLIP-FT | Video | AP | 0.9710+0.1043 |
| non retrouvé | CLIP-B-FT | GenVideo | AP | 91.52 | many-to-many generalization task, average on Dv-oodextrait citéCLIP-B-FT | Image | AP | 0.9152 |
| non retrouvé | DeMamba-CLIP-FT proposée | GenVideo | AP | 93.45 | many-to-many generalization task, average on Dv-oodextrait citéDeMamba-CLIP-FT | Video | AP | 0.9345+0.1930 |
Gain
DeMamba-XCLIP-FT surpasse XCLIP-B-FT avec une AP moyenne de 97.10 contre 86.77 sur la tâche de généralisation many-to-many.
which marks an improvement of 11.26%/17.72%/12.02% in recall/F1/AP over the original XCLIP.citation retrouvée
Jugement du relecteur
Points forts
- Introduction d'un dataset massif et diversifié (GenVideo) couvrant de nombreux générateurs récents.
- Évaluation rigoureuse incluant des scénarios inter-générateurs et de robustesse face à diverses dégradations.
- Proposition d'un module plug-and-play améliorant nettement les backbones existants.
Faiblesses
- L'entraînement des modèles basés sur Mamba est plus lent que celui des transformers classiques.
Menaces à la validité
- Possibilité de biais de domaine entre les différentes sources de vidéos réelles et générées.
Reproductibilité
Le code et le dataset sont annoncés comme disponibles sur GitHub, et les détails d'entraînement sont fournis dans le texte.
Limites déclarées par les auteurs
- L'efficacité d'entraînement sous-optimale du module DeMamba proposé, un problème courant avec le modèle Mamba.
Affirmations clés et leurs preuves
DeMamba améliore significativement la généralisabilité et la robustesse des modèles de détection sur le benchmark GenVideo.
Our extensive experiments demonstrate DeMamba’s superior generalizability and robustness on GenVideo compared to existing detectors.citation retrouvée
Pistes de contribution
Optimisation de l'efficacité d'entraînement des architectures Mamba pour la vidéo difficulté moyenne
L'article relève que l'entraînement de DeMamba souffre d'une efficacité sous-optimale inhérente aux modèles Mamba.
Premier pas. Explorer des mécanismes de distillation ou d'entraînement partiel pour réduire le temps de calcul.
Amélioration de la robustesse face à des perturbations combinées extrêmes difficulté faible
Bien que testé sur plusieurs dégradations, l'impact cumulé de plusieurs bruits simultanés n'est pas pleinement exploré.
Premier pas. Évaluer le modèle sur des pipelines de corruption séquentiels et renforcer l'architecture en conséquence.