|
英伟达正式推出1亿参数开源语音模型Nemotron3,支持最多8人同时发声的实时、离线音频分割识别,可直接对接Parakeet等主流语音识别系统,输出带匿名说话人标签的转写文本。该模型在VoiceArena v1语音分割基准测试中以14.72%的DER错误率登顶,比第二名低出近4.6个百分点。 这背后是英伟达在音频缓冲区优化上的核心突破,相比前代Streaming Sortformer,在1.04秒缓冲区的8个测试场景下平均错误率直降41%,还覆盖0.32秒到30.4秒的四级动态缓冲区调节区间。这一步几乎锁死同类开源模型的竞争空间,实时多人语音转写的落地门槛被直接拉低。 |
AI INSIGHT
英伟达推出免费1亿参数语音模型 支持8人实时分割识别
AI 摘要
英伟达正式推出1亿参数开源语音模型Nemotron3,支持最多8人同时发声的实时、离线音频分割识别,可直接对接Parakeet等主流语音识别系统,输出带匿名说话人标签的转写文本。该模型在VoiceArena v1语音分割基准测试中以14.72%的DER错误率登顶,比第二名低出近4.6个百分点。这背后是英伟达在音频缓冲区优化上的核心突破,相比前代Streaming Sortforme