首页/AI术语词典/视觉语言模型
计算机视觉难度 ★★★★

视觉语言模型

给它一张图,你可以问任何关于这张图的问题

分享:

📖 详细解释

🎯 一句话定义

给它一张图,你可以问任何关于这张图的问题

⚙️ 工作原理

VLM = Vision Language Model。通常架构:视觉编码器(ViT) + 投影层 + 大语言模型。图像被"翻译"成LLM能懂的token序列,然后像对话一样回答

💡 生活类比

"就像一个看图说话的小朋友——你给它看一张公园的照片,问它"有几个人在跑步?",它能数出来回答"

🌍 真实应用

图文问答、图像描述、文档理解(扫描件问答)、图表分析、医学影像辅助诊断

🔗 相关术语