Bibliothèque / fiche n°30
Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection
- Résultat principal
- 53.28F1 · OOD test set
- Solidité de l'évaluation
- 4/5jugée par le relecteur
- Générateurs non vus
- ouitest de généralisation
- Datasets
- FaceVid-Forensics-100K
- Chiffres vérifiés dans le PDF
- 5/5code disponible
Cet article introduit FaceVid-Forensics-100K, un grand dataset de 100 000 vidéos avec annotations textuelles fines, et propose un cadre de raisonnement multi-agent combinant quatre experts spécialisés et un agent juge pour la détection généralisable de deepfakes. Sur le banc d'essai hors domaine, l'approche atteint 53,28 % de F1 et surpasse les baselines.
Problème
Les détecteurs conventionnels et les MLLMs uniques échouent à capturer les artéfacts subtils et manquent de généralisation face aux nouvelles méthodes de génération de vidéos par IA.
Contributions
- Introduction de FaceVid-Forensics-100K, un dataset de 100 000 vidéos couvrant 33 méthodes de synthèse avec des annotations textuelles fines (observations et explications).
- Proposition d'un cadre de raisonnement multi-agent s'appuyant sur quatre experts indépendants (texture, éclairage, mouvement, physique) et un agent juge.
- Mise en place d'un pipeline d'entraînement séquentiel combinant supervised fine-tuning (SFT) et group relative policy optimization (GRPO).
Méthode
Quatre agents spécialisés analysent indépendamment des images échantillonnées de la vidéo selon quatre dimensions forensiques : texture, éclairage, mouvement et physique. Un agent juge central reçoit les rapports textuels générés par ces experts ainsi que, optionnellement, les trames vidéo originales. L'agent juge pèse les indices concordants ou conflictuels pour produire une décision finale binaire (réel ou fake) accompagnée d'une explication cohérente. Le système est entraîné en deux étapes via SFT puis GRPO.
- Architecture
- Backbone basé sur Qwen2.5-VL-7B, comprenant quatre agents d'observation indépendants et un agent juge central, optimisé par LoRA.
- Nouveauté
- Décomposition explicite de la détection de deepfakes en quatre perspectives forensiques spécialisées collaboratives associées à un agent juge, adossée à un nouveau dataset à annotations textuelles multidimensionnelles.
- Indices exploités
- spatialtemporellumineuxphysique
Évaluation
Entraînement sur le jeu d'entraînement (68,9K vidéos) et évaluation de la généralisation sur le jeu de test hors domaine (OOD) contenant 20 générateurs exclus de l'entraînement.
| Dataset | Usage | Détails |
|---|---|---|
| FaceVid-Forensics-100K | les deux | 100 000 vidéos au total (21 075 réelles et 78 925 fausses), réparties en 68,9K pour l'entraînement, 23,5K pour le test in-domain et 7,6K pour le test hors domaine (OOD). |
- Générateurs non vus testés
- oui
- Ablations
- oui
- Robustesse testée
- non rapporté
- Générateurs couverts
- Seedance 2.0, Sora 2, Runway Gen-2, Runway Gen-3 Alpha, Runway Gen-4 Turbo, CausVid, CogVideo, ModelScope, Pika, Text2Video-Zero, VideoCrafter2, CogVideoX1.5-5B-T, HunyuanVideo, HunyuanVideo-I2V, LTX-Video-13B-I, LTX-Video-13B-T, SkyReels-V2, SkyReels-V2-I2V-14B-540P, Wan2.1-T2V-1.3B, Wan2.1-VACE-1.3B-T, Wan2.2-I2V-14B, Wan2.2-T2V-14B, Wan2.2-TI2V-5B-I, Wan2.2-TI2V-5B-T, Hailuo AI, Kling v1, Pika 2.2, PixVerse v4.5
- Métriques
- AUC, ACC, AP, F1
- Baselines
- DFGaze, DFD-FCG, Effort, TALL++, TFCU, Qwen2.5-VL-7B, InternVL3.5-8B, MiMo-V2.5, Qwen3.6-35B-A3B, GPT-4o, GPT-5-mini, Gemini-2.5-Pro, Gemini-3.5-Flash, Skyra, VideoVeritas
Résultats
Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 4 · ≈ valeur retrouvée seule : 1 · introuvable : 0
| Méthode | Dataset | Métrique | Valeur | Réglage | |
|---|---|---|---|---|---|
| citation retrouvée | Ours (w/ Video) | OOD test set | F1 | 53.28 | Test hors domaine avec entrée vidéo pour le juge, après SFT et GRPOextrait citéCompared with the strongest single-model baseline, our approach improves F1 from 47.45% to 53.28%, an absolute gain of 5.83 percentage points. |
| ≈valeur retrouvée | Ours (w/o Video) | OOD test set | F1 | 51.01 | Test hors domaine sans entrée vidéo pour le juge, après SFT et GRPOextrait citéOn the reported benchmark, the full system achieves 69.87% accuracy, 81.82% recall, and 53.28% F1... Ours (w/o Video) 67.41 65.00 51.01 |
| citation retrouvée | Gemini-2.5-Pro (2025) | OOD test set | F1 | 47.45 | Évaluation zero-shot sur le jeu OODextrait citéCompared with the strongest single-model baseline, our approach improves F1 from 47.45% to 53.28% |
| citation retrouvée | VideoVeritas (ICML’26) | OOD test set | F1 | 43.22 | Évaluation sur le jeu OODextrait citéVideoVeritas (ICML’26) 57.87 78.96 43.22 |
| citation retrouvée | Skyra (CVPR’26) | OOD test set | F1 | 38.30 | Évaluation sur le jeu OODextrait citéSkyra (CVPR’26) 60.50 30.05 38.30 |
Gain
Amélioration absolue du score F1 de 5,83 points (passant de 47,45 % à 53,28 %) par rapport à la meilleure baseline à modèle unique (Gemini-2.5-Pro) sur le jeu de test hors domaine.
Compared with the strongest single-model baseline, our approach improves F1 from 47.45% to 53.28%, an absolute gain of 5.83 percentage points.citation retrouvée
Jugement du relecteur
Points forts
- Construction d'un dataset massif et diversifié couvrant 33 méthodes de synthèse récentes.
- Évaluation rigoureuse hors domaine (OOD) sur 20 générateurs exclus de l'entraînement.
- Analyse détaillée des performances par agent et par stratégie de raisonnement (ablations).
Faiblesses
- La performance en in-domain reste inférieure à celle des petits modèles visuels spécialisés (ex: TFCU atteint 98,66 % d'accuracy contre 87,34 % pour la méthode proposée).
- Le rappel élevé (81,82 %) s'accompagne d'une précision et d'un score F1 qui restent modérés (53,28 %), ce qui indique un taux de faux positifs potentiellement élevé.
Menaces à la validité
- Le dataset d'entraînement filtre les fausses vidéos en se basant sur un détecteur spécifique (Alt-Freezing), ce qui peut introduire un biais de sélection dans la curation des données.
- Les annotations textuelles de référence sont générées automatiquement par un ensemble de MLLMs et agrégées par DeepSeek-V4 Pro, ce qui peut propager des biais ou des hallucinations propres aux modèles d'annotation.
Reproductibilité
Les détails d'implémentation, les hyperparamètres, les scripts utilisant ms-swift et les prompts complets sont fournis dans les annexes, mais l'URL de la page du projet (https://xavierjiezou.github.io/ARGUS/) n'inclut pas explicitement un dépôt de code source public vérifiable dans le texte.
Limites déclarées par les auteurs
- Le framework introduit plus de prompts et d'appels comparé aux méthodes à modèle unique, entraînant un coût d'inférence supplémentaire.
Affirmations clés et leurs preuves
L'approche multi-agent surpasse tous les modèles testés, y compris les modèles propriétaires fermés (GPT et Gemini), sur le benchmark hors domaine.
Extensive evaluations on out-of-domain test sets show that, despite being composed entirely of small open-source MLLMs, our framework outperforms all methods including closed-source GPT and Gemini models and ranks first across all reported metrics on this benchmark.citation retrouvée
Laisser l'agent juge accéder directement aux trames vidéo en plus des rapports d'experts améliore encore les performances de généralisation.
Allowing the judge agent to access the video directly further increases F1 from 51.01% to 53.28%, indicating that the original visual information can effectively supplement the expert reports.citation retrouvée
Pistes de contribution
Réduction du coût d'inférence par compression de prompts difficulté moyenne
Le système multi-agent souffre d'un temps de calcul accru par rapport aux modèles unifiés en raison de la multiplication des rapports textuels.
Premier pas. Appliquer des techniques de compression de contexte ou de fusion de tokens inter-agents (type BEAVER) pour alléger l'entrée de l'agent juge.
Amélioration de la précision par calibration des faux positifs difficulté moyenne
Le cadre privilégie un rappel élevé au détriment de la précision, ce qui génère de nombreux faux positifs sur les vidéos réelles.
Premier pas. Modifier la fonction de récompense lors de l'étape GRPO pour pénaliser explicitement les faux positifs sur les vidéos authentiques.
Intégration d'outils forensiques bas niveau orientés pixels difficulté élevée
Les agents textuels s'appuient uniquement sur l'interprétation sémantique de trames échantillonnées et peuvent rater des traces purement fréquentielles ou de bas niveau.
Premier pas. Ajouter un agent expert spécialisé dans l'analyse spectrale (fréquentielle) ou de bruit de capteur en plus des quatre dimensions actuelles.