几天前,我们发布了讯飞星火语音基座大模型Spark-Audio-1.0-Preview。
基于这一语音基座大模型,我们在智能语音多个技术方向上实现创新突破,今天,我们正式发布最新一代语音识别大模型Spark-ASR-2.0。
在去年科大讯飞全球1024开发者节上,我们首发了非自回归语音识别大模型Spark-ASR-1.0,实现了推理效率的大幅提升,能够并行、一次性输出整个文本序列,效果相对提升16%,推理成本下降84%。
Spark-ASR-2.0通过非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术创新,整体的语音识别效果大幅提升,尤其在通用识别(中英文混合、方言、专业术语)、复杂声学场景识别(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面改善明显。在效果提升的同时,Spark-ASR-2.0的整体推理成本相对Spark-ASR-1.0仅增加了10%。
如果说过去的语音识别追求的是一字不差地还原所说内容,那么 Spark-ASR-2.0 则更进一步,让识别结果“流畅成文”——在提升识别准确率的同时,结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,让文字更连贯、语义更清晰。
核心识别场景效果提升
复杂声学场景等表现突出
相较于Spark-ASR-1.0,Spark-ASR-2.0在语音识别各核心场景上的效果有明显进步,尤其在中英文混合、方言、高噪声、文本流畅规范性等维度上的效果实现了大幅提升,WER(词错误率)明显降低。
Spark-ASR-2.0与当前业界最好水平相比,在方言、高噪和小音量上拥有显著优势,也再次证明了在复杂声学场景上语音识别的强大实力,主要任务效果均好于业界最优水平。
无论哪种语言,无论哪种情景,更准确、稳定、及时的语音识别体验一直是我们追求的目标。接下来,我们一起通过讯飞输入法的实际使用案例看看Spark-ASR-2.0究竟实现了哪些提升。
通用识别
Spark-ASR-2.0全面提升了通用识别能力,包含中英文混合、方言、专业术语识别等维度。
面对较为复杂的中英文混合情况,Spark-ASR-2.0表现游刃有余。
同时,Spark-ASR-2.0还支持全国202个城市的方言免切换识别,各种方言随心说,都能精准识别。
面对医学、化学、科技等领域中复杂拗口的专业术语,Spark-ASR-2.0的识别能力也显著提升,通过语音识别记录专业领域的相关讨论不在话下。
复杂声学场景识别
在语音基座大模型Spark-Audio-1.0-Preview发布时,我们曾特别提及了在复杂声学场景识别下高噪、小音量识别上的优势。基于此,Spark-ASR-2.0在这些场景下的表现也十分出色。
在现实中,不论身处在怎样复杂的声学场景下,讯飞输入法都能尽力听清、听懂你的言语。
上下文识别
语音识别的结果不止在于单个字词的准确,在识别过程中还会根据句子之内的其他内容和上下句来进行理解和判断,保证整段内容是否识别准确。
此次 Spark-ASR-2.0也重点升级了上下文识别能力,融合用户识别历史、修改记录及个性化热词等信息,对说话时的语境精准把握,能够有效消解语义歧义、易混淆发音、相似名词带来的识别偏差。
文本流畅规范性
使用语音输入时,我们的语气词、犹豫时重复的词语、口头禅都会被忠实记录,直接发送很容易被人看出是语音识别转写而成,内容显得有些潦草。Spark-ASR-2.0做到了“听懂”你的关键意思,直接输出符合你原意但更加流畅的内容,不再需要你手动修改润色。
同时,一句或者一段话最终完整的识别呈现,除了文字元素之外,标点、数字、符号和单位等细节的规范表达同样不可或缺。
Spark-ASR-2.0针对这些细微、却影响文本完整性与可读性的部分进行了专项优化。结合表达规范的前提下,为识别内容合理补全标点,准确呈现数字,给出标准的转换符号与单位,让“粗犷”的识别转写结果变身为工整、连贯、正式的文本,带来全新的语音输入体验。
Spark-ASR-2.0延续并深化了Spark-Audio-1.0-Preview语音基座大模型的技术能力,不仅构建了“非自回归识别 + LLM增强自回归识别”的专用语音识别架构,还通过中英文混合文本与声学联合增强、动态上下文注入等技术创新,进一步聚焦语音识别的准确性、实时性、语言理解和文本规范。
Spark-ASR-2.0训练架构
很多人最初对智能语音甚至人工智能技术的了解,就来源于语音识别。我们口中的话语实时变成在讯飞输入法上跳跃的文字,这种跨越模态的演变让人感到新鲜,也带来关于生产力的更多思考。
来到今天,智能语音技术的不断演进,大模型、语音基座大模型的出现与迭代,让早已被大家用惯的语音识别“卷”出了新花样。
Spark-ASR-2.0是我们在这一阶段为语音识别交出的一份全新答卷。从对识别准确度的孜孜以求,到语言、方言的拓展,又落入真实环境中的各类识别难题——再到现在,我们希望将语音识别做到好用的极致,让“忠实记录”变为“出口成章”,也让语音识别不再只是一段过程,而是成为一种工具、一个开启全新可能的入口。
未来,我们还将重点关注语音识别这三个方向的体验提升:一是无关说话人拒识,能在多人交谈和复杂噪声中精准锁定目标用户;二是语音内容编辑,基于对语音语义的理解,可通过语音指令对识别内容进行灵活修改;三是情感化结果呈现,结合情感表征和用户的情感表达,在标点、措辞、语气和格式等方面输出更贴合用户当前态度的识别结果。
除了API开放以及在讯飞输入法上更新之外,Spark-ASR-2.0还将陆续在讯飞AI眼镜、讯飞智能办公本、讯飞听见等更多产品业务上落地应用,为大家带来全新的使用体验。