669Identifiées −38 doublons 631Uniques −352 exclues 61Retenues au tri 57 à lire 4Lues 4 à décider 0Incluses

Bibliothèque / fiche n°116

Video text detection with multiattention feature fusion network

Xue et Ibrayimvenue non précisée2025 1 citations exclu au tri

Article

Cet article n'a pas de fiche

Statut : exclu au tri — filtre mots-clés : aucun terme du groupe « origine ». Seuls les articles retenus au tri et dont le PDF est accessible sont lus en entier.

Résumé des auteurs

Video text detection in dynamic scenes faces challenges such as motion blur, scale variation, and complex backgrounds. To address these issues, we propose a novel multi-attention feature fusion network (MAFFNet) based on Transformer architecture. This framework integrates Shuffle Attention (SA), Convolutional Block Attention Module (CBAM), and Feature Pyramid Enhancement Module (FPEM) to enhance feature representation and fusion. Specifically, SA dynamically adjusts channel and spatial weights to focus on critical text regions, while CBAM suppresses background noise through dual-path attention. FPEM recursively fuses multi-scale features to improve robustness against small and blurred text. Additionally, Reparameterized Batch Normalization (RepBN) optimizes feature distribution consistency for stable tracking. Experiments on ICDAR2015-Video and COCO-Text v2 datasets demonstrate that MAFFNet achieves state-of-the-art performance, with MOTA of 47.35%, MOTP of 75.59%, and IDF1 of 59.71%. Ablation studies validate the synergistic effects of SA, CBAM, FPEM, and RepBN, highlighting their contributions to improving detection accuracy and identity preservation in video sequences.