669Identifiées −38 doublons 631Uniques −352 exclues 61Retenues au tri 57 à lire 4Lues 4 à décider 0Incluses

Bibliothèque / fiche n°15

TUE-Detector: A Tool-Using Expert MLLM-Based Detector for AI-Generated Videos

Wu et al.arXiv2026 analysé 4/5

Article PDF Code

Cet article propose TUE-Detector, un framework d'experts MLLM utilisant des outils pour la découverte de preuves médiatisées par des outils afin de détecter les vidéos générées par IA. Il atteint de superbes performances sur les benchmarks ViF-Bench et GenVideo.

Problème

Identifier avec précision les artéfacts non naturels subtils mais mesurables dans les vidéos générées par IA, qui sont très divers et difficiles à détecter pour les MLLMs généraux sans expertise en manipulation d'outils.

Contributions

  • Proposition de TUE-Detector, un framework transformant un MLLM général en expert d'analyse vidéo orienté outils.
  • Introduction d'une stratégie de guidage par influence de l'enseignant pour l'apprentissage de l'utilisation des outils.
  • Mise en place d'une stratégie d'évolution d'outils guidée par l'expérience d'utilisation pour optimiser continuellement la boîte à outils.

Méthode

TUE-Detector adopte un processus d'entraînement en deux étapes. D'abord, il construit un ensemble d'outils heuristiques initiaux et entraîne le MLLM à utiliser des outils à l'aide d'un guidage basé sur les fonctions d'influence. Ensuite, il optimise conjointement le modèle par apprentissage par renforcement et fait évoluer dynamiquement la boîte à outils via des opérations de sélection, mutation et exploration.

Architecture
Initialisé à partir de Qwen2.5-VL-7B-Instruct, combiné à une boîte à outils d'analyse visuelle et temporelle écrite en Python, et optimisé par LoRA et GRPO.
Nouveauté
Premier framework à entraîner un MLLM général en un détecteur expert sur mesure utilisant des outils pour la détection de vidéos générées par IA, soutenu par une co-évolution modèle-outil.
Indices exploités
spatialtemporelfréquentielmouvementautre

Évaluation

Protocole zero-shot many-to-many sur GenVideo et évaluation par paires sur ViF-Bench.

DatasetUsageDétails
ViF-BenchtestEnviron 5 000 vidéos réelles et 5 000 fausses issues de générateurs de pointe.
GenVideotestEnviron 18 588 vidéos au total pour le protocole zero-shot many-to-many.
ViF-CoT-4Kentraînement4 034 lignes de labels de type Chain-of-Thought ancrés.
Générateurs non vus testés
oui
Ablations
oui
Robustesse testée
non rapporté
Générateurs couverts
Wan2.1-1.3B, CogVideoX-1.5, Wan2.2-5B, HunyuanVideo, VACE-1.3B, Wan2.2-14B, SkyReels-V2, LTX-Video-13B, Gen4-Turbo, Hailuo-02, Pika-V2, Pixverse-V4-5, Kling-V1, Sora-2, Sora, Morph Studio, Gen2, HotShot, Lavie, Show-1, MoonValley, Crafter, ModelScope, WildScrape
Métriques
AUC, ACC, AP, F1
Baselines
BusterX++, VidGuard-R1, Video-Veritas, IvyxDetector, Skyra, NPR, VideoMAE, MINTIME-CLIP, FTCN-CLIP, DeMamba-XCLIP

Résultats

Chaque valeur a été recherchée dans le PDF : citation retrouvée mot pour mot : 1 · ≈ valeur retrouvée seule : 4 · introuvable : 0

MéthodeDatasetMétriqueValeurRéglage
citation retrouvée Ours proposée ViF-BenchACC96.90 moyenne sur les générateurs
extrait citéTUE-Detector achieves the best average performance across generators.
≈valeur retrouvée Skyra ViF-BenchACC91.02 moyenne sur les générateurs
extrait citéSkyra [32] Acc Avg 91.02
≈valeur retrouvée Video-Veritas ViF-BenchACC90.64 moyenne sur les générateurs
extrait citéVideo-Veritas [55] Acc Avg 90.64
≈valeur retrouvée Ours proposée GenVideoR1.00 moyenne zero-shot many-to-many
extrait citéOurs R 1.00
≈valeur retrouvée VidGuard-R1 GenVideoR0.96 moyenne zero-shot many-to-many
extrait citéVidGuard-R1 [46] R 0.96

Gain

Amélioration significative de la précision moyenne sur ViF-Bench par rapport à la meilleure baseline Skyra (96.90% contre 91.02%).

Ours Acc 96.90 contre Skyra Acc 91.02 non retrouvé

Jugement du relecteur

Points forts

  • Approche originale de découverte de preuves assistée par des outils programmables.
  • Expérimentations exhaustives sur des benchmarks récents et difficiles (ViF-Bench, GenVideo).
  • Analyses d'ablation rigoureuses sur les stratégies clés et les étapes d'entraînement.

Faiblesses

  • Coût computationnel et complexité d'ingénierie importants dus à l'utilisation conjointe de MLLMs et d'une boucle d'évolution d'outils.

Menaces à la validité

  • Dépendance de la qualité d'apprentissage initiale envers le modèle enseignant (GPT-5.4).

Reproductibilité

Code source annoncé sur GitHub (github.com/Louis-YW/TUE), mais complexité élevée du pipeline complet à réimplémenter (étapes multiples, MLLM externe, exécution de scripts d'outils).

Limites déclarées par les auteurs

  • L'évaluation actuelle se focalise sur les vidéos générées de texte à vidéo et d'image à vidéo entièrement synthétiques, laissant la détection de manipulation de visages pour de futurs travaux.

Affirmations clés et leurs preuves

TUE-Detector surpasse les méthodes existantes sur ViF-Bench et GenVideo grâce à sa découverte de preuves assistée par outils.

Extensive experiments demonstrate the effectiveness of our framework. citation retrouvée

Pistes de contribution

Allègement de la boucle d'évolution des outils difficulté moyenne

L'approche actuelle nécessite des appels fréquents à un modèle enseignant lourd pour muter les outils, ce qui est coûteux.

Premier pas. Remplacer l'optimisation par LLM externe par des règles d'évolution génétiques locales sans API propriétaire.

Extension à la manipulation faciale difficulté moyenne

Les auteurs excluent explicitement la manipulation faciale (Deepfakes de visages) de leur évaluation actuelle.

Premier pas. Intégrer des outils spécifiques de détection d'artefacts faciaux (ex. inspection de la texture de la peau ou des yeux) dans la boîte à outils.