|
科大讯飞推出基于全国产化算力训练的语音基座大模型Spark - Audio - 1.0 - Preview。它采用0.65B音频编码器搭配30B大语言模型,用1300万小时音频等数据训练。支持语音转写等多任务,能识别99种语言及202种方言。现可正式体验,API将上线讯飞开放平台。 技术上,该模型在多语言、多方言识别上表现出色,比同尺寸的Qwen3.5 - omni - flash效果好,接近尺寸高一级的Qwen3.5 - omni - plus,评测得分超Gemini - 3.1 Pro。这彰显了国产算力在语音模型训练中的实力,有望提升其在语音技术市场的竞争力。 |
AI INSIGHT
0.65B编码器配30B MoE!讯飞星火语音基座大模型用国产算力训练上线
AI 摘要
科大讯飞推出基于全国产化算力训练的语音基座大模型Spark - Audio - 1.0 - Preview。它采用0.65B音频编码器搭配30B大语言模型,用1300万小时音频等数据训练。支持语音转写等多任务,能识别99种语言及202种方言。现可正式体验,API将上线讯飞开放平台。技术上,该模型在多语言、多方言识别上表现出色,比同尺寸的Qwen3.5 - omni - flash效