NLP与大模型难度 ★★★☆☆
上下文窗口
AI的"短期记忆"——窗口越大,能同时看的内容越多
分享:
📖 详细解释
🎯 一句话定义
AI的"短期记忆"——窗口越大,能同时看的内容越多
⚙️ 工作原理
Transformer的自注意力计算量是O(n²),n就是上下文长度。GPT-3是2K、GPT-4是8K/32K、GPT-4o是128K、有些模型达到1M+。长上下文靠RoPE/ALiBi等位置编码技术实现
💡 生活类比
"读书有人一次只能看一行,有人一次能看一页。上下文窗口就是AI一次能"看到"的字数"
🌍 真实应用
长上下文让AI能读完整本书、分析整个代码库、处理长文档摘要——不用再分段喂给AI了