单模型搞定30种语言与16种方言,阿里云发布Fun-ASR-Realtime,语义识别率逼近人工水平

标题:单模型搞定30种语言与16种方言,阿里云发布Fun-ASR-Realtime,语义识别率逼近人工水平

摘要:通义实验室推出Fun-ASR-Realtime实时语音识别模型,首次实现单一开源模型覆盖30种语言与16种方言,在东亚东南亚地区重点优化,取得87.8%语义准确率,首字延迟控制在百毫秒级,现已上架阿里云百炼平台。

长期以来,实时语音识别一直面临“语种覆盖广”与“识别精度高”难以两全的困境。为在单一模型中兼顾多语言与方言,同时保证极低延迟与高准确率,通常需要复杂的模型组合与资源堆叠。通义实验室最新发布的Fun-ASR-Realtime模型,试图打破这一平衡。

这款模型的一大亮点在于单模型支持30种语言与16种方言,尤其针对东亚、东南亚地区做了深度优化。这意味着,一个模型即可覆盖汉语普通话、英语、日语、韩语、粤语、闽南语乃至越南语、泰语等常见语种,极大降低了多语言场景下模型部署与维护的复杂度。对于出海应用或跨国服务而言,这无疑是显著的成本与效率优势。

在识别准确率上,Fun-ASR-Realtime展现了实际竞争力。根据通义实验室公布的工业级方言测评inhouse结果,该模型整体语义准确率达到87.8%,在多地方言上表现接近人工水平。相比传统方案,这一提升并非仅仅依赖更大的训练数据,而源自两项关键创新:上下文理解与动态热词注入。前者能有效处理同音词歧义,让模型在“工行”与“工商银行”之间做出正确判断;后者则允许用户实时注入品牌名、专业术语等,显著提升定制场景的识别精准度。

对于实时语音应用而言,延迟是致命指标。Fun-ASR-Realtime采用流式识别架构,首字延迟控制在百毫秒级,且准确率已接近离线模型水平。同时,模型支持多语言无缝切换,这意味着用户在对话中切换语种(如从普通话切到粤语),模型无需重启识别流,体验更加自然。

目前,Fun-ASR-Realtime的API已在阿里云百炼平台上线。对于语音交互产品开发者而言,这提供了一个值得关注的选项:用一个模型解决多语种、低延迟、高精度的刚需。建议产品团队在集成前,先针对自身场景中的典型语种与热词做小规模测试,以验证其语义消歧与动态热词注入的实际效果。