Évaluation de la robustesse spatiale et de la généralisation de RIFT face aux perturbations de diffusion sociale
- Lacune
- L'article [13] souffre d'une forte sensibilité au recadrage spatial et d'une évaluation restreinte sur les perturbations, tandis que l'article [24] montre que les conditions de diffusion sociale et de transcodage affaiblissent la fiabilité des détecteurs.
- Hypothèse
- En combinant le signal forensique du couplage multi-échelle de RIFT [13] avec les protocoles de robustesse et de diffusion sociale de RA-Bench [24], il est possible d'améliorer la stabilité des prédictions face aux transformations du monde réel.
- Approche
- Reprendre l'architecture RIFT [13], analyser l'impact des transformations de RA-Bench [24] (transcodage VP9-to-H.264, downsampling spatial 0.5x, compression et badges d'actualité) sur le couplage macro-micro, et évaluer si une augmentation de données ciblée ou un réalignement des patchs atténue la fragilité spatiale.
- Expériences
- Évaluer RIFT [13] zero-shot sur le benchmark RA-Bench [24] en mesurant la métrique F1-score et AUC sous différentes conditions de transcodage et de downsampling spatial.
- Nouveauté
- Contrairement à [13] qui teste uniquement un sous-ensemble restreint de perturbations et à [24] qui évalue des détecteurs standard, cette contribution évalue spécifiquement l'impact des dégradations de diffusion sociale sur un détecteur basé sur le couplage multi-échelle.
- Risques
- Le coût de calcul élevé du Transformer macro de RIFT [13] combiné à l'inférence sur de grands volumes de RA-Bench [24].
- Une chute drastique des performances de RIFT hors de son domaine d'entraînement initial (VidProM/GenVidBench).
- Premier pas
- Cloner les dépôts associés, configurer l'environnement d'extraction des flux macro et micro de RIFT [13], et charger un sous-échantillon de RA-Bench [24] pour valider la pipeline d'inférence.
Mind the Rift: Cross-Scale Coupling Mismatch...Can We Defend Against AI-Generated Video... chenhaoxing/Awesome-AI-Generated-Video-Detection