669Identifiées −38 doublons 631Uniques −352 exclues 61Retenues au tri 57 à lire 4Lues 4 à décider 0Incluses

Bibliothèque / fiche n°187

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

Wu et al.ECCV 20262026 analysé 4/5

Article PDF Code

Cet article propose SafeGuard, un framework multi-agent combinant une perception forensique de bas niveau et un raisonnement sémantique pour détecter les vidéos générées par IA à risque social. Il introduit également SafeVid, un nouveau benchmark de 20K vidéos couvrant 10 catégories de risques sociaux, et surpasse les méthodes existantes sur ce benchmark et quatre jeux de données publics.

Problème

Les détecteurs actuels souffrent d'un "Perception-Reasoning Gap" : les modèles orientés artefacts capturent les irrégularités statistiques mais manquent de raisonnement sémantique, tandis que les grands modèles vision-langage (LVLM) raisonnent sémantiquement mais sont insensibles aux indices forensiques fins, en plus d'une focalisation des benchmarks existants sur des scénarios bénins.

Contributions

  • Introduction de la tâche de détection de vidéos générées par IA à risque social, évaluant la plausibilité physique, la cohérence d'identité et la logique sociale.
  • Proposition de SafeGuard, un framework multi-agent intégrant un solveur perceptuel hiérarchique et un vérificateur autoréflexif pour combler le fossé entre perception et raisonnement.
  • Construction de SafeVid, un benchmark de 20K vidéos générées par 21 modèles à l'état de l'art à travers 10 catégories de risques sociaux.

Méthode

Le framework formule la détection comme un processus de raisonnement en boucle fermée et guidé par des preuves. Un solveur perceptuel hiérarchique formule des hypothèses de falsification sensibles aux risques sociaux, sélectionne des régions d'intérêt, extrait des indices forensiques ciblés à l'aide d'une boite à outils spécialisée, et produit un premier verdict. Ensuite, un vérificateur autoréflexif audite la cohérence entre l'hypothèse sémantique et les preuves physiques extraites, déclenchant un raffinement itératif si la fiabilité est insuffisante.

Architecture
Backbone LVLM (GPT-4o ou Qwen3-VL) pour le solveur, Gemini-2.5-Pro pour le vérificateur, Grounding DINO et SAM 2 pour la segmentation localisée, et une boîte à outils spécialisée (RAFT, Depth Anything V2, DINOv2, D3).
Nouveauté
L'intégration d'une collaboration multi-agent structurée en deux niveaux (solveur hiérarchique et vérificateur autoréflexif) pour lier l'extraction d'indices forensiques de bas niveau à un raisonnement sémantique de haut niveau sans nécessiter de ré-entraînement end-to-end.
Indices exploités
spatialtemporelfréquentielmouvementautre

Évaluation

Entraînement des outils forensiques sur le jeu de données d'entraînement GenVideo, puis évaluation zéro-shot / framework multi-agent sur SafeVid (divisé en ID et OOD) et quatre benchmarks publics (GenVideo, DVF, LOKI, GenVidBench). Les modèles généralistes et certains baselines sont évalués sur des sous-ensembles aléatoires de 30%.

DatasetUsageDétails
SafeVidles deux20K vidéos (10K réelles, 10K synthétiques) réparties en In-Domain et Out-of-Domain, couvrant 10 catégories de risques sociaux et 21 générateurs.
GenVideoentraînementGrand benchmark d'entraînement pour les outils forensiques et de référence.
DVFtest6.7k vidéos générées par diffusion produites par 8 générateurs.
LOKItest1.3k vidéos synthétisées dans divers contextes du monde réel.
GenVidBenchtest143k vidéos pour évaluer la généralisation cross-modèle et cross-scénario.
Générateurs non vus testés
oui
Ablations
oui
Robustesse testée
non rapporté
Générateurs couverts
Sora, Pika, Wan, Nano Banana Pro, Veo3, CogVideoX, HunYuanVideo, SVD, Latte, ZeroScope, SD, SEINE, VideoCrafter, LTX, YingAI, StepVideo, Vidu, OpenSoraPlan, MAGI, VACE, Luma
Métriques
ACC, F1
Baselines
NPR, FTCN, TALL, XCLIP, MINTIME, DeMamba, RestraV, NSG-VD, BusterX++, Skyra-RL, D3, LLaVA-Video, VideoLLaMA3, InternVL3.5, Qwen3-VL, Video-R1, Video-RFT, VideoChat-R1, GPT-4o, Gemini-2.5-Pro

Résultats

Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 1 · ≈ valeur retrouvée seule : 8 · introuvable : 0

MéthodeDatasetMétriqueValeurRéglage
citation retrouvée SafeGuard(GPT-4o) SafeVidACC85.5 Overall accuracy sur SafeVid
extrait citéExtensive experiments demonstrate the generalization of SafeGuard, improving accuracy on SafeVid by +18.7% and consistently outperforming prior methods across four public benchmarks.
≈valeur retrouvée SafeGuard(GPT-4o) GenVideoACC97.9 Accuracy sur GenVideo
extrait citéSafeGuard(GPT-4o) ... 97.9 95.6
≈valeur retrouvée SafeGuard(GPT-4o) DVFACC97.0 Accuracy sur DVF
extrait citéSafeGuard(GPT-4o) ... 97.0 93.2
≈valeur retrouvée SafeGuard(GPT-4o) LOKIACC81.7 Accuracy sur LOKI
extrait citéSafeGuard(GPT-4o) ... 81.7 77.7
≈valeur retrouvée SafeGuard(GPT-4o) GenVidBenchACC84.6 Accuracy sur GenVidBench
extrait citéSafeGuard(GPT-4o) ... 84.6 85.1
≈valeur retrouvée BusterX++ SafeVidACC66.8 Overall accuracy baseline
extrait citéBusterX++ [55] ... 66.8 61.7
≈valeur retrouvée NPR SafeVidACC65.0 Overall accuracy baseline
extrait citéNPR [44] ... 65.0 66.6
≈valeur retrouvée DeMamba SafeVidACC51.8 Overall accuracy baseline
extrait citéDeMamba [6] ... 51.8 56.1
≈valeur retrouvée GPT-4o SafeVidACC64.6 Overall accuracy baseline
extrait citéGPT-4o [19] ... 64.6 60.5

Gain

SafeGuard améliore la précision globale sur SafeVid de +18.7% par rapport à BusterX++ et surpasse les méthodes existantes sur les quatre benchmarks publics.

Extensive experiments demonstrate the generalization of SafeGuard, improving accuracy on SafeVid by +18.7% and consistently outperforming prior methods across four public benchmarks. citation retrouvée

Jugement du relecteur

Points forts

  • Proposition d'un nouveau benchmark diversifié axé sur la sécurité sociale et les risques (SafeVid).
  • Cadre méthodologique novateur combinant perception forensique de bas niveau et raisonnement par agents sans nécessiter de ré-entraînement global.
  • Évaluations approfondies incluant des études d'ablation détaillées sur les composants et les outils forensiques.

Faiblesses

  • L'évaluation de certains modèles et des évaluateurs humains repose sur des sous-échantillons aléatoires (30% ou 10%), ce qui peut introduire une variance d'échantillonnage.
  • Le coût computationnel et la latence d'inférence d'un framework multi-agent basé sur des LVLMs propriétaires multiples (GPT-4o et Gemini-2.5-Pro) ne sont pas discutés.

Menaces à la validité

  • Dépendance de la performance des outils forensiques bas niveau vis-à-vis de leur pré-entraînement sur GenVideo.
  • Utilisation de modèles propriétaires (GPT-4o, Gemini-2.5-Pro) dont les versions et les comportements peuvent évoluer dans le temps, affectant la reproductibilité exacte.

Reproductibilité

Le code source et le dataset sont annoncés comme publiquement disponibles sur GitHub. Les détails d'implémentation (hyperparamètres γ=0.5, L=3, prompts) sont partiellement fournis mais dépendent d'API tierces et de poids de modèles pré-entraînés.

Limites déclarées par les auteurs

  • Non rapporté

Affirmations clés et leurs preuves

Le framework SafeGuard comble le fossé entre perception et raisonnement en combinant des outils de perception forensique de bas niveau et un raisonnement sémantique.

To bridge this gap, we propose SafeGuard, a multi-agent framework that enables collaborative specialization between forensic perception and semantic reasoning. citation retrouvée

SafeVid est le premier dataset dédié à la sécurité sociale pour la détection de vidéos générées par IA, couvrant des scénarios à haut risque.

As shown in Table 1, SafeVid is the first AI-generated dataset dedicated to the social safety domain, focusing on safety-critical events rather than generic content. citation retrouvée

Pour ton PFE

Ce travail peut servir de référence méthodologique solide pour l'utilisation de frameworks multi-agents et de boîtes à outils forensiques combinant vision et langage. Le dataset SafeVid peut être directement réutilisé pour évaluer la robustesse des modèles face à des risques sociaux.

Pistes de contribution

Optimisation de l'efficacité computationnelle des agents forensiques difficulté moyenne

L'utilisation conjointe de plusieurs LVLMs lourds (GPT-4o et Gemini-2.5-Pro) engendre un coût d'inférence prohibitif pour du temps réel.

Premier pas. Remplacer les LVLMs propriétaires par des modèles open-source plus légers et étudier l'impact sur la précision.

Étude de la robustesse face aux attaques contradictoires sur les indices forensiques difficulté faible

Le texte ne teste aucune perturbation ciblée (compression poussée, bruit, recadrage) sur la robustesse du framework.

Premier pas. Soumettre les vidéos de SafeVid à diverses perturbations de bas niveau et mesurer la dégradation du solveur perceptuel.

Intégration d'un module temporel global pour les incohérences de longue durée difficulté élevée

Le solveur échantillonne uniformément 8 frames, ce qui peut occulter les incohérences narratives ou physiques se développant sur des échelles de temps plus longues.

Premier pas. Modifier la stratégie d'échantillonnage ou intégrer un mécanisme de mémoire temporelle dans le solveur hiérarchique.