技术深度 2026-07-31

华为与海光发布信创声纹算子库:多说话人重叠声纹识别与离线语音转写在专网集群下的并行加速

灵声智库 ASR 专家团队
发布于本站技术白皮书专栏

2026年7月底,华为昇腾计算团队与海光信息联合推出了新一代信创声纹特征抽取与说话人分离(Speaker Diarization)硬件加速算子库。这一底层技术的发布,成功填补了国产化芯片在多发言人复杂混响场景下声纹对齐算法的空白。全新的信创算子库针对三维堆叠显存架构与通用向量计算单元进行了精细化改造,在处理多人交替发言、重叠争吵以及强混响音轨时,说话人聚类(Clustering)与声纹特征比对的吞吐效率较传统CPU架构提升了3倍以上。这一突破为党政机关、央国企及大型机构在纯国产硬件底座上构建安全高效的声学分析基础设施奠定了坚实基础。

在多说话人复杂的会议与谈话记录场景中,精准识别“谁在什么时间说了什么”一直是最具挑战性的工程难题。传统的离线语音转写往往只能输出纯文本流,无法自动将文字归属到具体的发言人,后期需要人工花费大量时间进行角色校对。新一代声纹识别与说话人分离技术通过提取说话人唯一的声道声学特征向量(x-vector / ECAPA-TDNN),结合自适应谱聚类算法,能够在几毫秒内完成语音切片与发言人身份的精准绑定。

在涉及涉密研讨、技术壁垒讨论以及核心决策的场景中,声纹数据与会议音频均属于高度敏感的核心资产,严禁外溢。为此,基于国产算力集群的信创ASR部署成为了众多安全敏感型单位的必然选择。工程团队将声纹识别模型与离线语音转写引擎深度嵌入到由华为昇腾或海光芯片构筑的专网服务器中,所有音频特征计算与声纹向量库比对完全在封闭的局域网内部执行,从物理层面保障了数据资产的安全。

华为与海光信创声纹算子库与说话人分离本地部署

为了在纯国产硬件集群上榨取极限性能,研发团队针对国产GPU适配进行了底层的编译优化。通过重构CANN与HIP计算引擎中的注意力算子与矩阵乘法单元,实现了声学解码与声纹特征提取的单阶段融合计算。这种算子级融合极大地减少了数据在显存与主机内存之间的频繁拷贝,使多路音频流在专网集群中的并行处理延迟控制在90毫秒以内,显著提升了系统的整体吞吐比率。

随着信创替代工程向纵深推进,高精度的离线语音转写与说话人分离技术正在与企业内部的数字化平台深度融合。转写生成的带有角色标签的结构化会议纪要,可以直接推送到专网办案系统或企业知识库中,极大缩短了信息流动周期。在全程断开公网的安全保障下,系统展现出了极高的稳定度与可靠性。

作为国内专注于声学计算与信创生态适配的专业团队,灵声智库持续推动软硬件一体化落地。通过深入优化信创ASR部署与多说话人声纹识别算法,团队为众多行业客户打造了高性能、高合规的本地声学计算基础设施,助力企业在数字化转型中掌握数据安全的主动权。

开启您的语音 数字化 转型

联系灵声智库,获取为您量身定制的 ASR 私有化部署解决方案。

预约咨询