计算机视觉难度 ★★★★☆
视觉语言模型
给它一张图,你可以问任何关于这张图的问题
分享:
📖 详细解释
🎯 一句话定义
给它一张图,你可以问任何关于这张图的问题
⚙️ 工作原理
VLM = Vision Language Model。通常架构:视觉编码器(ViT) + 投影层 + 大语言模型。图像被"翻译"成LLM能懂的token序列,然后像对话一样回答
💡 生活类比
"就像一个看图说话的小朋友——你给它看一张公园的照片,问它"有几个人在跑步?",它能数出来回答"
🌍 真实应用
图文问答、图像描述、文档理解(扫描件问答)、图表分析、医学影像辅助诊断