673Identifiées −38 doublons 635Uniques −364 exclues 110Retenues au tri 103 à lire 7Lues 7 à décider 0Incluses

Bibliothèque / fiche n°30

Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection

Zou et al.arXiv2026 analysé 4/5

Résultat principal
53.28F1 · OOD test set
Solidité de l'évaluation
4/5jugée par le relecteur
Générateurs non vus
ouitest de généralisation
Datasets
FaceVid-Forensics-100K
Chiffres vérifiés dans le PDF
5/5code disponible

Cet article introduit FaceVid-Forensics-100K, un grand dataset de 100 000 vidéos avec annotations textuelles fines, et propose un cadre de raisonnement multi-agent combinant quatre experts spécialisés et un agent juge pour la détection généralisable de deepfakes. Sur le banc d'essai hors domaine, l'approche atteint 53,28 % de F1 et surpasse les baselines.

Problème

Les détecteurs conventionnels et les MLLMs uniques échouent à capturer les artéfacts subtils et manquent de généralisation face aux nouvelles méthodes de génération de vidéos par IA.

Contributions

  • Introduction de FaceVid-Forensics-100K, un dataset de 100 000 vidéos couvrant 33 méthodes de synthèse avec des annotations textuelles fines (observations et explications).
  • Proposition d'un cadre de raisonnement multi-agent s'appuyant sur quatre experts indépendants (texture, éclairage, mouvement, physique) et un agent juge.
  • Mise en place d'un pipeline d'entraînement séquentiel combinant supervised fine-tuning (SFT) et group relative policy optimization (GRPO).

Méthode

Quatre agents spécialisés analysent indépendamment des images échantillonnées de la vidéo selon quatre dimensions forensiques : texture, éclairage, mouvement et physique. Un agent juge central reçoit les rapports textuels générés par ces experts ainsi que, optionnellement, les trames vidéo originales. L'agent juge pèse les indices concordants ou conflictuels pour produire une décision finale binaire (réel ou fake) accompagnée d'une explication cohérente. Le système est entraîné en deux étapes via SFT puis GRPO.

Architecture
Backbone basé sur Qwen2.5-VL-7B, comprenant quatre agents d'observation indépendants et un agent juge central, optimisé par LoRA.
Nouveauté
Décomposition explicite de la détection de deepfakes en quatre perspectives forensiques spécialisées collaboratives associées à un agent juge, adossée à un nouveau dataset à annotations textuelles multidimensionnelles.
Indices exploités
spatialtemporellumineuxphysique

Évaluation

Entraînement sur le jeu d'entraînement (68,9K vidéos) et évaluation de la généralisation sur le jeu de test hors domaine (OOD) contenant 20 générateurs exclus de l'entraînement.

DatasetUsageDétails
FaceVid-Forensics-100Kles deux100 000 vidéos au total (21 075 réelles et 78 925 fausses), réparties en 68,9K pour l'entraînement, 23,5K pour le test in-domain et 7,6K pour le test hors domaine (OOD).
Générateurs non vus testés
oui
Ablations
oui
Robustesse testée
non rapporté
Générateurs couverts
Seedance 2.0, Sora 2, Runway Gen-2, Runway Gen-3 Alpha, Runway Gen-4 Turbo, CausVid, CogVideo, ModelScope, Pika, Text2Video-Zero, VideoCrafter2, CogVideoX1.5-5B-T, HunyuanVideo, HunyuanVideo-I2V, LTX-Video-13B-I, LTX-Video-13B-T, SkyReels-V2, SkyReels-V2-I2V-14B-540P, Wan2.1-T2V-1.3B, Wan2.1-VACE-1.3B-T, Wan2.2-I2V-14B, Wan2.2-T2V-14B, Wan2.2-TI2V-5B-I, Wan2.2-TI2V-5B-T, Hailuo AI, Kling v1, Pika 2.2, PixVerse v4.5
Métriques
AUC, ACC, AP, F1
Baselines
DFGaze, DFD-FCG, Effort, TALL++, TFCU, Qwen2.5-VL-7B, InternVL3.5-8B, MiMo-V2.5, Qwen3.6-35B-A3B, GPT-4o, GPT-5-mini, Gemini-2.5-Pro, Gemini-3.5-Flash, Skyra, VideoVeritas

Résultats

Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 4 · ≈ valeur retrouvée seule : 1 · introuvable : 0

MéthodeDatasetMétriqueValeurRéglage
citation retrouvée Ours (w/ Video) OOD test setF153.28 Test hors domaine avec entrée vidéo pour le juge, après SFT et GRPO
extrait citéCompared with the strongest single-model baseline, our approach improves F1 from 47.45% to 53.28%, an absolute gain of 5.83 percentage points.
≈valeur retrouvée Ours (w/o Video) OOD test setF151.01 Test hors domaine sans entrée vidéo pour le juge, après SFT et GRPO
extrait citéOn the reported benchmark, the full system achieves 69.87% accuracy, 81.82% recall, and 53.28% F1... Ours (w/o Video) 67.41 65.00 51.01
citation retrouvée Gemini-2.5-Pro (2025) OOD test setF147.45 Évaluation zero-shot sur le jeu OOD
extrait citéCompared with the strongest single-model baseline, our approach improves F1 from 47.45% to 53.28%
citation retrouvée VideoVeritas (ICML’26) OOD test setF143.22 Évaluation sur le jeu OOD
extrait citéVideoVeritas (ICML’26) 57.87 78.96 43.22
citation retrouvée Skyra (CVPR’26) OOD test setF138.30 Évaluation sur le jeu OOD
extrait citéSkyra (CVPR’26) 60.50 30.05 38.30

Gain

Amélioration absolue du score F1 de 5,83 points (passant de 47,45 % à 53,28 %) par rapport à la meilleure baseline à modèle unique (Gemini-2.5-Pro) sur le jeu de test hors domaine.

Compared with the strongest single-model baseline, our approach improves F1 from 47.45% to 53.28%, an absolute gain of 5.83 percentage points. citation retrouvée

Jugement du relecteur

Points forts

  • Construction d'un dataset massif et diversifié couvrant 33 méthodes de synthèse récentes.
  • Évaluation rigoureuse hors domaine (OOD) sur 20 générateurs exclus de l'entraînement.
  • Analyse détaillée des performances par agent et par stratégie de raisonnement (ablations).

Faiblesses

  • La performance en in-domain reste inférieure à celle des petits modèles visuels spécialisés (ex: TFCU atteint 98,66 % d'accuracy contre 87,34 % pour la méthode proposée).
  • Le rappel élevé (81,82 %) s'accompagne d'une précision et d'un score F1 qui restent modérés (53,28 %), ce qui indique un taux de faux positifs potentiellement élevé.

Menaces à la validité

  • Le dataset d'entraînement filtre les fausses vidéos en se basant sur un détecteur spécifique (Alt-Freezing), ce qui peut introduire un biais de sélection dans la curation des données.
  • Les annotations textuelles de référence sont générées automatiquement par un ensemble de MLLMs et agrégées par DeepSeek-V4 Pro, ce qui peut propager des biais ou des hallucinations propres aux modèles d'annotation.

Reproductibilité

Les détails d'implémentation, les hyperparamètres, les scripts utilisant ms-swift et les prompts complets sont fournis dans les annexes, mais l'URL de la page du projet (https://xavierjiezou.github.io/ARGUS/) n'inclut pas explicitement un dépôt de code source public vérifiable dans le texte.

Limites déclarées par les auteurs

  • Le framework introduit plus de prompts et d'appels comparé aux méthodes à modèle unique, entraînant un coût d'inférence supplémentaire.

Affirmations clés et leurs preuves

L'approche multi-agent surpasse tous les modèles testés, y compris les modèles propriétaires fermés (GPT et Gemini), sur le benchmark hors domaine.

Extensive evaluations on out-of-domain test sets show that, despite being composed entirely of small open-source MLLMs, our framework outperforms all methods including closed-source GPT and Gemini models and ranks first across all reported metrics on this benchmark. citation retrouvée

Laisser l'agent juge accéder directement aux trames vidéo en plus des rapports d'experts améliore encore les performances de généralisation.

Allowing the judge agent to access the video directly further increases F1 from 51.01% to 53.28%, indicating that the original visual information can effectively supplement the expert reports. citation retrouvée

Pistes de contribution

Réduction du coût d'inférence par compression de prompts difficulté moyenne

Le système multi-agent souffre d'un temps de calcul accru par rapport aux modèles unifiés en raison de la multiplication des rapports textuels.

Premier pas. Appliquer des techniques de compression de contexte ou de fusion de tokens inter-agents (type BEAVER) pour alléger l'entrée de l'agent juge.

Amélioration de la précision par calibration des faux positifs difficulté moyenne

Le cadre privilégie un rappel élevé au détriment de la précision, ce qui génère de nombreux faux positifs sur les vidéos réelles.

Premier pas. Modifier la fonction de récompense lors de l'étape GRPO pour pénaliser explicitement les faux positifs sur les vidéos authentiques.

Intégration d'outils forensiques bas niveau orientés pixels difficulté élevée

Les agents textuels s'appuient uniquement sur l'interprétation sémantique de trames échantillonnées et peuvent rater des traces purement fréquentielles ou de bas niveau.

Premier pas. Ajouter un agent expert spécialisé dans l'analyse spectrale (fréquentielle) ou de bruit de capteur en plus des quatre dimensions actuelles.