Bibliothèque / fiche n°15
TUE-Detector: A Tool-Using Expert MLLM-Based Detector for AI-Generated Videos
Cet article propose TUE-Detector, un framework d'experts MLLM utilisant des outils pour la découverte de preuves médiatisées par des outils afin de détecter les vidéos générées par IA. Il atteint de superbes performances sur les benchmarks ViF-Bench et GenVideo.
Problème
Identifier avec précision les artéfacts non naturels subtils mais mesurables dans les vidéos générées par IA, qui sont très divers et difficiles à détecter pour les MLLMs généraux sans expertise en manipulation d'outils.
Contributions
- Proposition de TUE-Detector, un framework transformant un MLLM général en expert d'analyse vidéo orienté outils.
- Introduction d'une stratégie de guidage par influence de l'enseignant pour l'apprentissage de l'utilisation des outils.
- Mise en place d'une stratégie d'évolution d'outils guidée par l'expérience d'utilisation pour optimiser continuellement la boîte à outils.
Méthode
TUE-Detector adopte un processus d'entraînement en deux étapes. D'abord, il construit un ensemble d'outils heuristiques initiaux et entraîne le MLLM à utiliser des outils à l'aide d'un guidage basé sur les fonctions d'influence. Ensuite, il optimise conjointement le modèle par apprentissage par renforcement et fait évoluer dynamiquement la boîte à outils via des opérations de sélection, mutation et exploration.
- Architecture
- Initialisé à partir de Qwen2.5-VL-7B-Instruct, combiné à une boîte à outils d'analyse visuelle et temporelle écrite en Python, et optimisé par LoRA et GRPO.
- Nouveauté
- Premier framework à entraîner un MLLM général en un détecteur expert sur mesure utilisant des outils pour la détection de vidéos générées par IA, soutenu par une co-évolution modèle-outil.
- Indices exploités
- spatialtemporelfréquentielmouvementautre
Évaluation
Protocole zero-shot many-to-many sur GenVideo et évaluation par paires sur ViF-Bench.
| Dataset | Usage | Détails |
|---|---|---|
| ViF-Bench | test | Environ 5 000 vidéos réelles et 5 000 fausses issues de générateurs de pointe. |
| GenVideo | test | Environ 18 588 vidéos au total pour le protocole zero-shot many-to-many. |
| ViF-CoT-4K | entraînement | 4 034 lignes de labels de type Chain-of-Thought ancrés. |
- Générateurs non vus testés
- oui
- Ablations
- oui
- Robustesse testée
- non rapporté
- Générateurs couverts
- Wan2.1-1.3B, CogVideoX-1.5, Wan2.2-5B, HunyuanVideo, VACE-1.3B, Wan2.2-14B, SkyReels-V2, LTX-Video-13B, Gen4-Turbo, Hailuo-02, Pika-V2, Pixverse-V4-5, Kling-V1, Sora-2, Sora, Morph Studio, Gen2, HotShot, Lavie, Show-1, MoonValley, Crafter, ModelScope, WildScrape
- Métriques
- AUC, ACC, AP, F1
- Baselines
- BusterX++, VidGuard-R1, Video-Veritas, IvyxDetector, Skyra, NPR, VideoMAE, MINTIME-CLIP, FTCN-CLIP, DeMamba-XCLIP
Résultats
Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 1 · ≈ valeur retrouvée seule : 4 · introuvable : 0
| Méthode | Dataset | Métrique | Valeur | Réglage | |
|---|---|---|---|---|---|
| citation retrouvée | Ours proposée | ViF-Bench | ACC | 96.90 | moyenne sur les générateursextrait citéTUE-Detector achieves the best average performance across generators. |
| ≈valeur retrouvée | Skyra | ViF-Bench | ACC | 91.02 | moyenne sur les générateursextrait citéSkyra [32] Acc Avg 91.02 |
| ≈valeur retrouvée | Video-Veritas | ViF-Bench | ACC | 90.64 | moyenne sur les générateursextrait citéVideo-Veritas [55] Acc Avg 90.64 |
| ≈valeur retrouvée | Ours proposée | GenVideo | R | 1.00 | moyenne zero-shot many-to-manyextrait citéOurs R 1.00 |
| ≈valeur retrouvée | VidGuard-R1 | GenVideo | R | 0.96 | moyenne zero-shot many-to-manyextrait citéVidGuard-R1 [46] R 0.96 |
Gain
Amélioration significative de la précision moyenne sur ViF-Bench par rapport à la meilleure baseline Skyra (96.90% contre 91.02%).
Ours Acc 96.90 contre Skyra Acc 91.02non retrouvé
Jugement du relecteur
Points forts
- Approche originale de découverte de preuves assistée par des outils programmables.
- Expérimentations exhaustives sur des benchmarks récents et difficiles (ViF-Bench, GenVideo).
- Analyses d'ablation rigoureuses sur les stratégies clés et les étapes d'entraînement.
Faiblesses
- Coût computationnel et complexité d'ingénierie importants dus à l'utilisation conjointe de MLLMs et d'une boucle d'évolution d'outils.
Menaces à la validité
- Dépendance de la qualité d'apprentissage initiale envers le modèle enseignant (GPT-5.4).
Reproductibilité
Code source annoncé sur GitHub (github.com/Louis-YW/TUE), mais complexité élevée du pipeline complet à réimplémenter (étapes multiples, MLLM externe, exécution de scripts d'outils).
Limites déclarées par les auteurs
- L'évaluation actuelle se focalise sur les vidéos générées de texte à vidéo et d'image à vidéo entièrement synthétiques, laissant la détection de manipulation de visages pour de futurs travaux.
Affirmations clés et leurs preuves
TUE-Detector surpasse les méthodes existantes sur ViF-Bench et GenVideo grâce à sa découverte de preuves assistée par outils.
Extensive experiments demonstrate the effectiveness of our framework.citation retrouvée
Pistes de contribution
Allègement de la boucle d'évolution des outils difficulté moyenne
L'approche actuelle nécessite des appels fréquents à un modèle enseignant lourd pour muter les outils, ce qui est coûteux.
Premier pas. Remplacer l'optimisation par LLM externe par des règles d'évolution génétiques locales sans API propriétaire.
Extension à la manipulation faciale difficulté moyenne
Les auteurs excluent explicitement la manipulation faciale (Deepfakes de visages) de leur évaluation actuelle.
Premier pas. Intégrer des outils spécifiques de détection d'artefacts faciaux (ex. inspection de la texture de la peau ou des yeux) dans la boîte à outils.