首页/AI术语词典/Vision Transformer
计算机视觉难度 ★★★★★

Vision Transformer

不再用"滑动窗口"扫描图像,而是把图片切成块直接用Transformer处理

分享:

📖 详细解释

🎯 一句话定义

不再用"滑动窗口"扫描图像,而是把图片切成块直接用Transformer处理

⚙️ 工作原理

将图像切分为16x16的patch序列,每个patch当作一个token输入Transformer。靠自注意力捕获全局关系

💡 生活类比

"CNN像逐寸扫描地图找目标,ViT像一眼看完整张地图然后圈出重点区域"

🌍 真实应用

GPT-4o的视觉理解、CLIP图文匹配、医学影像分析——ViT正在取代CNN成为视觉新标准

🔗 相关术语