673Identifiées −38 doublons 635Uniques −364 exclues 110Retenues au tri 103 à lire 7Lues 7 à décider 0Incluses

Bibliothèque / fiche n°44

DeMamba: AI-generated video detection on million-scale GenVideo benchmark

Chen et al.Science China Information Sciences2026 9 citations analysé 4/5

Solidité de l'évaluation
4/5jugée par le relecteur
Générateurs non vus
ouitest de généralisation
Datasets
GenVideo
Chiffres vérifiés dans le PDF
0/4code disponible

Cet article introduit GenVideo, un dataset à grande échelle pour la détection de vidéos générées par IA, et propose DeMamba, un module plug-and-play basé sur Mamba pour modéliser les incohérences spatio-temporelles. Les expériences démontrent des performances de généralisation et de robustesse supérieures face aux baselines existantes.

Problème

Les méthodes actuelles de détection d'images ne modélisent pas les incohérences temporelles, tandis que les méthodes de détection vidéo peinent à modéliser efficacement les incohérences spatiales locales, ce qui limite leur généralisation.

Contributions

  • Introduction du premier dataset à grande échelle pour la détection de vidéos générées par IA, nommé GenVideo.
  • Conception de deux tâches d'évaluation : la classification vidéo inter-générateur et la classification vidéo dégradée.
  • Proposition d'un module plug-and-play nommé Detail Mamba (DeMamba) pour modéliser les incohérences spatio-temporelles.

Méthode

Le module DeMamba s'intègre à un extracteur de caractéristiques visuelles pour analyser les incohérences spatiales et temporelles. Les caractéristiques des frames vidéo sont divisées en zones spatiales par consolidation spatiale. Une stratégie de balayage continu (continuous scan) est appliquée sur chaque région segmentée pour préserver la continuité spatiale et capturer les dynamiques temporelles via un bloc S6 (Mamba). Enfin, les caractéristiques globales et locales issues du module sont agrégées et transmises à une tête de classification MLP.

Architecture
Backbone (CLIP ou XCLIP), module plug-and-play Detail Mamba (basé sur le mécanisme S6), et une tête de classification MLP avec fonction de perte binary cross-entropy.
Nouveauté
L'utilisation d'un modèle d'espace d'états structuré (Mamba) adapté aux dimensions spatio-temporelles via une stratégie de balayage continu (continuous scan) pour détecter des vidéos générées par IA.
Indices exploités
spatialtemporel

Évaluation

Entraînement sur un ensemble de base (many-to-many ou one-to-many) et test sur un ensemble hors domaine (Dv-ood) comprenant des générateurs non vus ou des vidéos dégradées.

DatasetUsageDétails
GenVideoles deux2 314 182 vidéos au total (2 294 594 pour l'entraînement et 19 588 pour le test), combinant des vidéos réelles et des vidéos générées par diverses méthodes.
Générateurs non vus testés
oui
Ablations
oui
Robustesse testée
H.264 compression, JPEG compression, FLIP, Crop, text watermark, image watermark, Gaussian noise, color transform
Générateurs couverts
Sora, Pika, SVD, Gen2, VideoCrafter, DynamiCrafter, SEINE, Latte, OpenSora, ModelScope, ZeroScope, I2VGen-XL
Métriques
AUC, ACC, AP, F1
Baselines
F3Net, NPR, STIL, VideoMAE-B, MINTIME-CLIP-B, FTCN-CLIP-B, TALL, CLIP-B-PT, CLIP-B-FT, XCLIP-B-PT, XCLIP-B-FT

Résultats

Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 0 · ≈ valeur retrouvée seule : 0 · introuvable : 4

MéthodeDatasetMétriqueValeurRéglage
non retrouvé XCLIP-B-FT GenVideoAP86.77 many-to-many generalization task, average on Dv-ood
extrait citéXCLIP-B-FT | Video | AP | 0.8677
non retrouvé DeMamba-XCLIP-FT proposée GenVideoAP97.10 many-to-many generalization task, average on Dv-ood
extrait citéDeMamba-XCLIP-FT | Video | AP | 0.9710+0.1043
non retrouvé CLIP-B-FT GenVideoAP91.52 many-to-many generalization task, average on Dv-ood
extrait citéCLIP-B-FT | Image | AP | 0.9152
non retrouvé DeMamba-CLIP-FT proposée GenVideoAP93.45 many-to-many generalization task, average on Dv-ood
extrait citéDeMamba-CLIP-FT | Video | AP | 0.9345+0.1930

Gain

DeMamba-XCLIP-FT surpasse XCLIP-B-FT avec une AP moyenne de 97.10 contre 86.77 sur la tâche de généralisation many-to-many.

which marks an improvement of 11.26%/17.72%/12.02% in recall/F1/AP over the original XCLIP. citation retrouvée

Jugement du relecteur

Points forts

  • Introduction d'un dataset massif et diversifié (GenVideo) couvrant de nombreux générateurs récents.
  • Évaluation rigoureuse incluant des scénarios inter-générateurs et de robustesse face à diverses dégradations.
  • Proposition d'un module plug-and-play améliorant nettement les backbones existants.

Faiblesses

  • L'entraînement des modèles basés sur Mamba est plus lent que celui des transformers classiques.

Menaces à la validité

  • Possibilité de biais de domaine entre les différentes sources de vidéos réelles et générées.

Reproductibilité

Le code et le dataset sont annoncés comme disponibles sur GitHub, et les détails d'entraînement sont fournis dans le texte.

Limites déclarées par les auteurs

  • L'efficacité d'entraînement sous-optimale du module DeMamba proposé, un problème courant avec le modèle Mamba.

Affirmations clés et leurs preuves

DeMamba améliore significativement la généralisabilité et la robustesse des modèles de détection sur le benchmark GenVideo.

Our extensive experiments demonstrate DeMamba’s superior generalizability and robustness on GenVideo compared to existing detectors. citation retrouvée

Pistes de contribution

Optimisation de l'efficacité d'entraînement des architectures Mamba pour la vidéo difficulté moyenne

L'article relève que l'entraînement de DeMamba souffre d'une efficacité sous-optimale inhérente aux modèles Mamba.

Premier pas. Explorer des mécanismes de distillation ou d'entraînement partiel pour réduire le temps de calcul.

Amélioration de la robustesse face à des perturbations combinées extrêmes difficulté faible

Bien que testé sur plusieurs dégradations, l'impact cumulé de plusieurs bruits simultanés n'est pas pleinement exploré.

Premier pas. Évaluer le modèle sur des pipelines de corruption séquentiels et renforcer l'architecture en conséquence.