【前沿开源速递】国内顶尖人工智能研究机构 DeepSeek 团队今日宣布,正式向全球开源其最新研发的轻量化多模态音视频大模型架构及全套预训练权重。该模型不仅在多语言理解与复杂声学表征基准上刷新了同等参数规模的国际纪录,更因其对 INT4/INT8 权重量化的开箱即用支持,以及对国内主流自主算力平台的深度兼容,迅速引发了整个信创软件生态与 AI 算力圈的深度测评热潮。
发布后数小时内,华为昇腾(CANN)、海光信息(DTK)以及摩尔线程(MUSA)等国产芯片厂商相继发布了针对该模型的首发优化驱动与算子库补丁,展示了国产软硬件协同生态在前沿多模态时代的惊人响应速度。

开源模型的三大技术突破点
根据 DeepSeek 官方发布的技术论文与代码仓库,本次开源的多模态架构在计算效率层面实现了多项关键创新:
- 动态稀疏跨模态注意力机制:模型在处理长时音频与视频流时,通过自适应动态注意力稀疏化,将传统注意力机制的平方阶计算复杂度大幅削减,使得单张显卡能够承载的音频吞吐量提升了近 4 倍。
- 原生支持 INT4/INT8 对称量化:依托模型量化加速技术,模型权重在量化后几乎未出现困惑度(Perplexity)衰减,显存占用直降 72%,单台标准服务器即可轻松跑满全尺寸多模态模型。
- 指令级算子融合设计:算子底层全面采用非依赖性标准张量表示,便于各类异构计算平台直接进行底层硬件指令映射,消除了以往开源模型移植国产算力底座时的兼容性障碍。
权威评测实验室与第三方跑分报告
随着开源权重的释出,多家国家级信创工程实验室与知名科技媒体第一时间公布了基准测评报告:
- 千路高并发吞吐实测:在针对金融录音质检与政企内部长音频处理的压力测试中,单台搭载国产加速卡的服务器成功实现了对 1000 路以上实时流的稳定并发解码,系统在连续 72 小时极限压测下保持零显存溢出(OOM),展现了卓越的高并发语音处理效能。
- 异构算力利用率表现:得益于芯片厂商定制驱动的底层配合,在华为昇腾与海光 DCU 上的实测算力利用率突破 86.5%,彻底打破了过去“国产芯片算力参数高但实际发挥不足”的刻板印象,为大规模推进国产GPU适配提供了强有力的实证支撑。
产业影响透视:信创基础设施落地迈入深水区
DeepSeek 此次高质量开源,不仅极大丰富了全球开源大模型的技术多样性,更为国内各大企业与关键基础设施推进自主可控的信创ASR部署注入了一剂强心针。以往由于算法生态高度绑定国外计算框架,许多行业在尝试本地化部署时面临高昂的二次开发成本;而如今,开源算法与国产算力底座的无缝握手,正加速推动企业机房从“局部技术试点”全面转向“规模化业务替代”。
在关注前沿大模型开源与国产异构算力协同的演进路径中,灵声智库专注于打造高性能、全栈自主可控的本地化声学推理中台,持续助力现代企业构建坚实可靠的数字基础设施。