Bibliothèque / fiche n°187
SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection
Cet article propose SafeGuard, un framework multi-agent combinant une perception forensique de bas niveau et un raisonnement sémantique pour détecter les vidéos générées par IA à risque social. Il introduit également SafeVid, un nouveau benchmark de 20K vidéos couvrant 10 catégories de risques sociaux, et surpasse les méthodes existantes sur ce benchmark et quatre jeux de données publics.
Problème
Les détecteurs actuels souffrent d'un "Perception-Reasoning Gap" : les modèles orientés artefacts capturent les irrégularités statistiques mais manquent de raisonnement sémantique, tandis que les grands modèles vision-langage (LVLM) raisonnent sémantiquement mais sont insensibles aux indices forensiques fins, en plus d'une focalisation des benchmarks existants sur des scénarios bénins.
Contributions
- Introduction de la tâche de détection de vidéos générées par IA à risque social, évaluant la plausibilité physique, la cohérence d'identité et la logique sociale.
- Proposition de SafeGuard, un framework multi-agent intégrant un solveur perceptuel hiérarchique et un vérificateur autoréflexif pour combler le fossé entre perception et raisonnement.
- Construction de SafeVid, un benchmark de 20K vidéos générées par 21 modèles à l'état de l'art à travers 10 catégories de risques sociaux.
Méthode
Le framework formule la détection comme un processus de raisonnement en boucle fermée et guidé par des preuves. Un solveur perceptuel hiérarchique formule des hypothèses de falsification sensibles aux risques sociaux, sélectionne des régions d'intérêt, extrait des indices forensiques ciblés à l'aide d'une boite à outils spécialisée, et produit un premier verdict. Ensuite, un vérificateur autoréflexif audite la cohérence entre l'hypothèse sémantique et les preuves physiques extraites, déclenchant un raffinement itératif si la fiabilité est insuffisante.
- Architecture
- Backbone LVLM (GPT-4o ou Qwen3-VL) pour le solveur, Gemini-2.5-Pro pour le vérificateur, Grounding DINO et SAM 2 pour la segmentation localisée, et une boîte à outils spécialisée (RAFT, Depth Anything V2, DINOv2, D3).
- Nouveauté
- L'intégration d'une collaboration multi-agent structurée en deux niveaux (solveur hiérarchique et vérificateur autoréflexif) pour lier l'extraction d'indices forensiques de bas niveau à un raisonnement sémantique de haut niveau sans nécessiter de ré-entraînement end-to-end.
- Indices exploités
- spatialtemporelfréquentielmouvementautre
Évaluation
Entraînement des outils forensiques sur le jeu de données d'entraînement GenVideo, puis évaluation zéro-shot / framework multi-agent sur SafeVid (divisé en ID et OOD) et quatre benchmarks publics (GenVideo, DVF, LOKI, GenVidBench). Les modèles généralistes et certains baselines sont évalués sur des sous-ensembles aléatoires de 30%.
| Dataset | Usage | Détails |
|---|---|---|
| SafeVid | les deux | 20K vidéos (10K réelles, 10K synthétiques) réparties en In-Domain et Out-of-Domain, couvrant 10 catégories de risques sociaux et 21 générateurs. |
| GenVideo | entraînement | Grand benchmark d'entraînement pour les outils forensiques et de référence. |
| DVF | test | 6.7k vidéos générées par diffusion produites par 8 générateurs. |
| LOKI | test | 1.3k vidéos synthétisées dans divers contextes du monde réel. |
| GenVidBench | test | 143k vidéos pour évaluer la généralisation cross-modèle et cross-scénario. |
- Générateurs non vus testés
- oui
- Ablations
- oui
- Robustesse testée
- non rapporté
- Générateurs couverts
- Sora, Pika, Wan, Nano Banana Pro, Veo3, CogVideoX, HunYuanVideo, SVD, Latte, ZeroScope, SD, SEINE, VideoCrafter, LTX, YingAI, StepVideo, Vidu, OpenSoraPlan, MAGI, VACE, Luma
- Métriques
- ACC, F1
- Baselines
- NPR, FTCN, TALL, XCLIP, MINTIME, DeMamba, RestraV, NSG-VD, BusterX++, Skyra-RL, D3, LLaVA-Video, VideoLLaMA3, InternVL3.5, Qwen3-VL, Video-R1, Video-RFT, VideoChat-R1, GPT-4o, Gemini-2.5-Pro
Résultats
Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 1 · ≈ valeur retrouvée seule : 8 · introuvable : 0
| Méthode | Dataset | Métrique | Valeur | Réglage | |
|---|---|---|---|---|---|
| citation retrouvée | SafeGuard(GPT-4o) | SafeVid | ACC | 85.5 | Overall accuracy sur SafeVidextrait citéExtensive experiments demonstrate the generalization of SafeGuard, improving accuracy on SafeVid by +18.7% and consistently outperforming prior methods across four public benchmarks. |
| ≈valeur retrouvée | SafeGuard(GPT-4o) | GenVideo | ACC | 97.9 | Accuracy sur GenVideoextrait citéSafeGuard(GPT-4o) ... 97.9 95.6 |
| ≈valeur retrouvée | SafeGuard(GPT-4o) | DVF | ACC | 97.0 | Accuracy sur DVFextrait citéSafeGuard(GPT-4o) ... 97.0 93.2 |
| ≈valeur retrouvée | SafeGuard(GPT-4o) | LOKI | ACC | 81.7 | Accuracy sur LOKIextrait citéSafeGuard(GPT-4o) ... 81.7 77.7 |
| ≈valeur retrouvée | SafeGuard(GPT-4o) | GenVidBench | ACC | 84.6 | Accuracy sur GenVidBenchextrait citéSafeGuard(GPT-4o) ... 84.6 85.1 |
| ≈valeur retrouvée | BusterX++ | SafeVid | ACC | 66.8 | Overall accuracy baselineextrait citéBusterX++ [55] ... 66.8 61.7 |
| ≈valeur retrouvée | NPR | SafeVid | ACC | 65.0 | Overall accuracy baselineextrait citéNPR [44] ... 65.0 66.6 |
| ≈valeur retrouvée | DeMamba | SafeVid | ACC | 51.8 | Overall accuracy baselineextrait citéDeMamba [6] ... 51.8 56.1 |
| ≈valeur retrouvée | GPT-4o | SafeVid | ACC | 64.6 | Overall accuracy baselineextrait citéGPT-4o [19] ... 64.6 60.5 |
Gain
SafeGuard améliore la précision globale sur SafeVid de +18.7% par rapport à BusterX++ et surpasse les méthodes existantes sur les quatre benchmarks publics.
Extensive experiments demonstrate the generalization of SafeGuard, improving accuracy on SafeVid by +18.7% and consistently outperforming prior methods across four public benchmarks.citation retrouvée
Jugement du relecteur
Points forts
- Proposition d'un nouveau benchmark diversifié axé sur la sécurité sociale et les risques (SafeVid).
- Cadre méthodologique novateur combinant perception forensique de bas niveau et raisonnement par agents sans nécessiter de ré-entraînement global.
- Évaluations approfondies incluant des études d'ablation détaillées sur les composants et les outils forensiques.
Faiblesses
- L'évaluation de certains modèles et des évaluateurs humains repose sur des sous-échantillons aléatoires (30% ou 10%), ce qui peut introduire une variance d'échantillonnage.
- Le coût computationnel et la latence d'inférence d'un framework multi-agent basé sur des LVLMs propriétaires multiples (GPT-4o et Gemini-2.5-Pro) ne sont pas discutés.
Menaces à la validité
- Dépendance de la performance des outils forensiques bas niveau vis-à-vis de leur pré-entraînement sur GenVideo.
- Utilisation de modèles propriétaires (GPT-4o, Gemini-2.5-Pro) dont les versions et les comportements peuvent évoluer dans le temps, affectant la reproductibilité exacte.
Reproductibilité
Le code source et le dataset sont annoncés comme publiquement disponibles sur GitHub. Les détails d'implémentation (hyperparamètres γ=0.5, L=3, prompts) sont partiellement fournis mais dépendent d'API tierces et de poids de modèles pré-entraînés.
Limites déclarées par les auteurs
- Non rapporté
Affirmations clés et leurs preuves
Le framework SafeGuard comble le fossé entre perception et raisonnement en combinant des outils de perception forensique de bas niveau et un raisonnement sémantique.
To bridge this gap, we propose SafeGuard, a multi-agent framework that enables collaborative specialization between forensic perception and semantic reasoning.citation retrouvée
SafeVid est le premier dataset dédié à la sécurité sociale pour la détection de vidéos générées par IA, couvrant des scénarios à haut risque.
As shown in Table 1, SafeVid is the first AI-generated dataset dedicated to the social safety domain, focusing on safety-critical events rather than generic content.citation retrouvée
Pour ton PFE
Ce travail peut servir de référence méthodologique solide pour l'utilisation de frameworks multi-agents et de boîtes à outils forensiques combinant vision et langage. Le dataset SafeVid peut être directement réutilisé pour évaluer la robustesse des modèles face à des risques sociaux.
Pistes de contribution
Optimisation de l'efficacité computationnelle des agents forensiques difficulté moyenne
L'utilisation conjointe de plusieurs LVLMs lourds (GPT-4o et Gemini-2.5-Pro) engendre un coût d'inférence prohibitif pour du temps réel.
Premier pas. Remplacer les LVLMs propriétaires par des modèles open-source plus légers et étudier l'impact sur la précision.
Étude de la robustesse face aux attaques contradictoires sur les indices forensiques difficulté faible
Le texte ne teste aucune perturbation ciblée (compression poussée, bruit, recadrage) sur la robustesse du framework.
Premier pas. Soumettre les vidéos de SafeVid à diverses perturbations de bas niveau et mesurer la dégradation du solveur perceptuel.
Intégration d'un module temporel global pour les incohérences de longue durée difficulté élevée
Le solveur échantillonne uniformément 8 frames, ce qui peut occulter les incohérences narratives ou physiques se développant sur des échelles de temps plus longues.
Premier pas. Modifier la stratégie d'échantillonnage ou intégrer un mécanisme de mémoire temporelle dans le solveur hiérarchique.