两年前谈国产 AI 芯片,话题基本停留在“能不能用”。2026 年这个问题已经有了答案,新的问题变成“什么场景下用、怎么算账、生态跟不跟得上”。
给企业做本地 AI 部署咨询时,国产算力已经从“不考虑”变成“必须评估一轮”——原因很实际:进口高端卡买不到(管制)也买不起(价格),而国产卡在推理场景的性价比已经能打。
2026 年的几组关键数据
| 指标 | 数据 |
|---|---|
| 国产 AI 芯片出货量 | 165 万张,首次突破市场四成 |
| 昇腾出货与份额 | 81.2 万张,份额 20.3%,居首 |
| 寒武纪 2026 上半年营收 | 59.96 亿元,同比 +108% |
| 全国日均 Token 调用量 | 2026 年 6 月突破 500 万亿 |
| DeepSeek 昇腾部署计划 | 16 万颗昇腾 950DT,乌兰察布 1GW 数据中心,只做推理不做训练,交付周期超 1 年 |
| GLM-5.3-Flash(“牛来”) | 320B 参数 / 18B 激活(MoE),10 万颗国产芯片集群,性能对标国际顶级模型,价格约为其 1/40 |
昇腾 950DT 的规格值得单独看:144GB HiZQ 2.0 HBM、FP8 算力 1 PFLOPS、芯片互联带宽 2TB/s。144GB 显存这个规格很关键——它决定了单卡能装下多大的模型,也决定了推理场景的服务能力。

最值得注意的信号:头部玩家选择“只推理不训练”
DeepSeek 的 16 万颗昇腾集群明确只做推理、不做训练。这个选择背后的逻辑,对企业做本地部署有直接参考价值:
训练和推理是两种完全不同的负载
| 维度 | 训练 | 推理 |
|---|---|---|
| 算力特征 | 超大规模并行、集群互联带宽是瓶颈、需要数千卡同步 | 单卡或小集群即可、显存容量和吞吐是瓶颈 |
| 软件栈依赖 | 重度依赖 CUDA 生态(分布式训练框架、算子库、混合精度工具链) | 相对轻,主流推理框架(vLLM、SGLang、TensorRT-LLM 的国产替代)已有国产适配 |
| 失败成本 | 一次训练任务跑数周,中途出错损失巨大,稳定性要求极高 | 单次请求失败可重试,容错空间大 |
| 国产卡成熟度 | 仍在追赶,生态是主要障碍 | 已可用且性价比有优势 |
结论:企业 99% 的本地 AI 需求属于推理,不属于训练。你不需要训练一个大模型,你需要的是把一个现成的开源模型(或 API 模型)部署到本地,服务内部业务——知识库问答、文档处理、客服辅助、代码补全、图像识别。这些全是推理负载,正是国产卡已经能打的领域。
GLM 的案例说明生态在正向循环
GLM-5.3-Flash 用 10 万颗国产芯片集群,做到 320B 参数 / 18B 激活的 MoE 架构,性能对标国际顶级模型而价格约为其 1/40。两个意义:
- 模型侧主动适配国产硬件——不再是“硬件做出来等软件适配”,而是模型设计时就考虑国产集群的特性(MoE 的稀疏激活正好降低对单卡算力和互联带宽的要求)。
- 价格 1/40 是决定性的商业变量。对企业来说,API 调用成本降一个数量级,很多原本“想想算了”的场景就变得可行——比如全量文档的智能归档、每通客服通话的实时质检。

企业本地部署的可行性评估清单
不要从“买什么卡”开始,从这四个问题开始:
问题一:你的场景真的需要本地部署吗?
触发本地部署的硬条件(满足任一才值得):
- 数据不能出域:医疗影像、金融客户资料、政企涉密文档、制造工艺参数——这类数据上传云端 API 违反内部制度或法规。
- 调用量大到 API 成本超过自建:粗略算法是月 API 费用超过 1.5 万元且会持续一年以上,自建开始划算(一台推理服务器 15-40 万元,三年折旧)。
- 需要离线或低延迟:工厂车间、外勤设备、内网隔离环境、或要求响应延迟低于 100ms 的实时场景。
如果三条都不满足,直接用云端 API 是更理性的选择——不用养运维、不用管硬件折旧、模型随云端升级。很多企业的“本地 AI”项目最后成了机房里一台吃灰的服务器。
问题二:需要多大的模型和多强的硬件?
| 场景 | 模型规模建议 | 硬件门槛 | 参考方案 |
|---|---|---|---|
| 个人/小组知识库问答 | 7B-14B 量化(INT4) | 16-24GB 显存单卡 | RTX 4090/5090 工作站,2-4 万元 |
| 部门级文档处理、客服辅助(10-50人) | 14B-32B 量化,或 MoE 小激活模型 | 单卡 48-96GB 或双卡 24GB | 国产推理卡(昇腾 300I/寒武纪 MLU370)或 RTX 6000 Ada,8-25 万元 |
| 企业级多部门并发(50-500人)+ RAG 知识库 | 32B-70B,或 MoE(如 GLM 系列 320B/18B激活) | 4-8 卡推理服务器,单卡 96-144GB | 昇腾 Atlas 800I A2 / 寒武纪思元集群,50-150 万元 |
| 需要微调/LoRA 训练 | 基于 7B-32B 做领域适配 | 显存需求约为推理的 3-5 倍 | 建议租用云端算力,自建微调集群性价比极低 |
关键提醒:显存容量比算力(TOPS/FLOPS)更重要。推理场景下,模型装不进显存就完全跑不起来,而算力不足只是慢一点。144GB 显存的昇腾 950DT 这类规格,价值在于能单卡装下 70B 级模型的 FP8 权重,不需要多卡切分(多卡切分会引入通信开销)。
问题三:软件栈和运维谁来做?
这是国产算力落地的真实瓶颈,也是项目失败的头号原因:
- CUDA 生态的迁移成本。如果你的技术团队全部经验在 CUDA 上,切换到昇腾 CANN 或寒武纪 Neuware 需要学习成本,算子覆盖度和调试工具链的成熟度仍有差距(尤其是自定义算子和冷门模型结构)。
- 模型适配不是“下载即用”。主流开源模型(Qwen、GLM、Llama、DeepSeek)在国产卡上的适配程度不一,量化方案、推理框架版本、驱动版本三者要匹配,试错周期以周计。
- 运维需要专人。推理服务要管并发调度、显存碎片、模型热更新、监控告警,这和运维一台 Web 服务器不是一个量级。没有专职人员的项目,半年后基本处于“能用但没人敢动”的状态。
务实建议:优先选择厂商已经做过适配认证的模型+硬件组合(昇腾有 ModelZoo 兼容列表,寒武纪有适配模型库),不要自己趟第一个坑。以及,把实施和一年运维打包给集成商,比自己招人便宜。
问题四:信创合规要求到什么程度?
如果是政企、国企、事业单位采购,往往有信创(信息技术应用创新)目录要求,这时选型逻辑完全不同:
- 必须查产品是否在信创目录内、是否有相关资质认证(如商用密码、等保、国产化率要求)。
- 不只是 AI 卡,整机(CPU 用鲲鹏/海光/飞腾)、操作系统(麒麟/统信UOS)、数据库(达梦/人大金仓/openGauss)、中间件都要成套考虑,否则验收过不了。
- 预算要留足:信创整套方案的价格通常是商用方案的 1.5-2.5 倍,且实施周期更长。
采购避坑:四个常见错误
- 只看算力参数买卡。FP16 算力 1 PFLOPS 但显存只有 32GB,跑不了 70B 模型;显存 144GB 但互联带宽低,多卡并行效率差。参数要看整体匹配。
- 忽略交付周期。DeepSeek 那批 16 万颗昇腾的交付周期超过一年——热门国产卡的订货周期普遍在 3-12 个月,2026 年算力紧张背景下更久。项目排期必须把这个算进去,不要按“下单两周到货”规划。
- 不做 POC 就批量采购。用你自己的真实业务数据、真实并发压力、真实模型跑一轮 POC(2-4 周),测吞吐、延迟、稳定性、运维复杂度。跳过这步的项目翻车率极高。
- 低估配套的电力和散热。一台 8 卡推理服务器功耗 5-8kW,普通办公室的供电和空调根本压不住。要么放机房(需确认供电容量和制冷),要么托管到持证 IDC 服务商。这一点和下面的液冷话题直接相关——单机柜功率超过 20kW 后,风冷就无能为力了。
宇际航提供企业 AI 基础设施咨询与实施:本地部署可行性评估(免费)、硬件选型与采购(含国产算力与进口卡)、机房供电散热改造、IDC 机房托管对接(协助对接持证服务商,双路市电+UPS+柴发+7×24 值守)、系统集成与一年运维打包。也做广州服务器批发(Dell/HP/联想/超微/浪潮/华为)。我们不做“卖完就走”的生意——评估阶段如果结论是“你不需要本地部署”,我们会直接告诉你,然后帮你把云端 API 方案配好。电话 020-39029800。