AI INSIGHT

音频大模型记不住说话人 32K上下文下全员表现不及格

AI新闻 太平洋科技 2026-10-09 21:00
AI 摘要

墨尔本大学联合新南威尔士大学团队推出全新音频大模型记忆评测基准VoxMem,专门针对现有评测忽略声学身份信息、无法单独验证历史长度影响的痛点设计。这套基准采用“声学证据×记忆操作”二维分类法,覆盖15种组合,共包含3196个评测实例、34743段语音会话,总音频时长约177小时,可在8K到64K不同上下文长度下保持测试题目完全一致,彻底解决了过往同类评测中不同上下文维度下测试样本错

墨尔本大学联合新南威尔士大学团队推出全新音频大模型记忆评测基准VoxMem,专门针对现有评测忽略声学身份信息、无法单独验证历史长度影响的痛点设计。这套基准采用“声学证据×记忆操作”二维分类法,覆盖15种组合,共包含3196个评测实例、34743段语音会话,总音频时长约177小时,可在8K到64K不同上下文长度下保持测试题目完全一致,彻底解决了过往同类评测中不同上下文维度下测试样本错位、变量不统一的问题,让行业内对音频大模型长时记忆能力的横向对比拥有了公平统一的标尺,也填补了音频领域专门聚焦声学属性记忆能力评测的长期空白。

技术上,团队实测15款主流音频大模型后发现,32K上下文下所有模型整体准确率均未突破40%,仅语义记忆表现尚可,对说话人身份、情绪语气、环境声的记忆能力随上下文拉长快速跳水。这背后直接戳破了当前音频大模型的核心短板,瓶颈集中在声学信息的识别、定位与关联绑定环节,而非推理能力,直接给后续行业优化指明了明确方向,也为音频大模型在会议纪要、多轮语音交互、长音频内容分析等落地场景的能力迭代提供了清晰的攻坚路径参考。

来源:太平洋科技
阅读原文