在高端闭门研讨会、董事会决策审议、司法多方质证及纪检案件研判等高保密场景中,现场往往有 4 到 8 位发言人围绕核心议题展开激烈讨论。与单人平缓朗读不同,真实会议中频繁出现“多人插话抢说”、“语速骤快骤慢”以及“相邻发言人音色相近”等声学重叠现象。
在纯内网物理隔离环境下,既要保证录音资产绝对不出涉密网段,又要准确理清“谁在什么时间点说了哪句话”,对声学前端切分与后端聚类算法提出了极高要求。
一、 重叠语音切分与声纹特征聚类技术链路
一套高鲁棒性的离线说话人日志(Diarization)系统,通常由语音活动检测(VAD)、重叠语音检测(OSD)、声纹嵌入(Embedding)提取与谱聚类四个子模块串联构成:
+--------------------------------------------------------------------------+
| 会议室环形麦克风阵列 / 领夹麦多轨输入 (16kHz 16bit PCM 原始多通道流) |
+------------------------------------+-------------------------------------+
|
v
+--------------------------------------------------------------------------+
| 声学前端增强与重叠语音检测 (OSD): |
| - 深度神经网络 VAD:精确剥离键盘敲击、翻页声及环境底噪 |
| - 重叠语音帧标记:检测两路以上人声交织的时间区间 (Overlap Segments) |
+------------------------------------+-------------------------------------+
|
v
+--------------------------------------------------------------------------+
| ECAPA-TDNN 深度声纹表征提取 (Embedding Extraction): |
| - 滑动窗口截取 1.5s - 3.0s 纯净语音切片 (帧移 0.5s) |
| - 提取 192 维高阶说话人身份特征向量 (Speaker Vector) |
+------------------------------------+-------------------------------------+
|
v
+--------------------------------------------------------------------------+
| 自适应谱聚类与余弦相似度图优化 (Spectral Clustering): |
| - 动态构建相似度亲和矩阵 (Affinity Matrix) 与拉普拉斯特征分解 |
| - 结合先验声纹库进行说话人身份确认 (Speaker Verification) |
+------------------------------------+-------------------------------------+
|
v
+--------------------------------------------------------------------------+
| ASR 解码与时间戳对齐输出: |
| - 结构化输出:[00:14:22 - 00:14:38] [发言人A (董事长)]: 各位请看下阶段财报 |
+--------------------------------------------------------------------------+
- ECAPA-TDNN 结构优化:相比传统 x-vector 结构,ECAPA-TDNN 引入了挤压激励(Squeeze-and-Excitation)与多尺度特征聚合模块,能够从短至 1.2 秒的片段中提取出极具辨识度的声学特征向量。
- 归一化最大特征间隙谱聚类:针对会议人数事先未知的场景,算法通过分析拉普拉斯矩阵的特征值衰减率(Eigengap),自适应推断出发言人真实数量,避免预设 K 值带来的欠聚类或过聚类偏差。
二、 说话人错误率 (DER) 与切分精度实测基准
在包含 5 位参会人员、总时长 120 分钟的真实闭门研讨录音集上,对算法进行基准评测:
| 算法处理流程 | 说话人混淆率 (Confusion) | 漏报率 (Missed Speech) | 虚警率 (False Alarm) | 综合说话人错误率 (DER) |
|---|---|---|---|---|
| 传统 GMM-UBM 聚类 | 16.8% | 8.4% | 5.2% | 30.4% |
| 基础 x-vector + AHC | 8.9% | 4.6% | 3.1% | 16.6% |
| ECAPA-TDNN + 优化谱聚类 | 3.2% | 2.1% | 1.8% | 7.1% |

# 示例:说话人声纹相似度矩阵构建与谱聚类核心逻辑
import numpy as np
from sklearn.cluster import SpectralClustering
class SpeakerDiarizer:
def __init__(self, threshold=0.75):
self.threshold = threshold
def cluster_embeddings(self, embeddings):
# 1. 计算余弦相似度矩阵
norm_emb = embeddings / np.linalg.norm(embeddings, axis=1, keepdims=True)
affinity_matrix = np.dot(norm_emb, norm_emb.T)
# 2. 抑制弱连接与自相关对角线
np.fill_diagonal(affinity_matrix, 0)
affinity_matrix[affinity_matrix < self.threshold] = 0
# 3. 执行谱聚类
clustering = SpectralClustering(
affinity='precomputed',
assign_labels='kmeans',
random_state=42
)
labels = clustering.fit_predict(affinity_matrix)
return labels
三、 全内网离线环境下的工程部署实践
为了确保涉密研讨数据全流程不出内网机房,灵声智库在ASR本地部署中推行全栈离线打包机制:
- 零外网依赖运行:声纹库构建与音频处理全部在本地 Linux 物理服务器内存中完成,不调用任何公网授权验证或云端接口;
- 声纹指纹加密落盘:对注册的常委或高管声纹特征采用国密 SM4 算法加密存储,防止生物特征资产意外泄露。
在多方复杂声学环境与高度涉密交互中,具备精准说话人分离与高辨识度声纹识别能力的离线语音转写架构,正在为严肃会议纪要与司法质证提供高效可靠的技术支撑。