arxivcs.CV2026-07-14
Inhibited Self-Attention: Sharpening Focus in Vision Transformers
Peter R. D. van der Wal, Nicola Strisciuglio, George Azzopardi
Vision Transformers (ViTs) have demonstrated remarkable performance in computer vision tasks. However, their self-attention mechanism often diffuses focus across background regions, relying on spurious correlations rather than object-relevant cues. Inspired by inhibitory mechanis…