|
字节跳动旗下Seed团队发布最新研究论文,找到了大语言模型处理超长文本时性能随机波动的核心诱因。实验数据显示,部分主流开源大模型受该问题影响,长文本检索准确率的最大落差可达40个百分点。这背后的核心原因是分块KV缓存压缩技术引入的“相位敏感性”――也就是Token相对压缩窗口边界的位置坐标干扰了模型输出。 技术上该结论直接推翻了传统平均基准测试的评估逻辑,给后续长上下文推理稳定性优化提供了明确的理论锚点,相当于直接给所有长文本大模型的优化指明了破局方向。 |
AI INSIGHT
字节Seed团队揭开大模型长文本性能波动核心谜团
AI 摘要
字节跳动旗下Seed团队发布最新研究论文,找到了大语言模型处理超长文本时性能随机波动的核心诱因。实验数据显示,部分主流开源大模型受该问题影响,长文本检索准确率的最大落差可达40个百分点。这背后的核心原因是分块KV缓存压缩技术引入的“相位敏感性”――也就是Token相对压缩窗口边界的位置坐标干扰了模型输出。技术上该结论直接推翻了传统平均基准测试的评估逻辑,给后续长上下文推理稳定性优化