英伟达拟投资d-Matrix:GPU、CUDA生态与3D DRAM存算一体迎来 “世纪握手”
一笔投资,两条技术线,一个正在被重写的 AI 芯片架构叙事。
一、英伟达把钱递给了一家 "存算一体" 公司
10 月 9 日,据 The Information 报道,英伟达计划投资 AI 服务器芯片开发商 d-Matrix。消息一出,行业内的关注点迅速从 "谁被投了" 转向 "英伟达为什么投"—— 因为 d-Matrix 所走的技术路线,与英伟达传统 GPU 架构并非同一条轨道。
d-Matrix 成立于 2019 年,迄今累计融资约 5 亿美元,微软旗下风险投资机构 M12 亦是其早期投资者。但真正让这家公司值得被英伟达 "高看一眼" 的,不是融资额,而是它的产品逻辑:其 Corsair 推理平台采用数字存内计算(DIMC)架构,核心思路是让矩阵乘法直接在存储单元内部完成,而非把数据搬到计算单元再运算。
更值得注意的背景是,今年 9 月 d-Matrix 刚宣布加入英伟达 NVLink Fusion 生态,其下一代推理 XPU Raptor 将被直接接入英伟达 MGX 机架参考架构,与 Vera CPU、NVLink 交换机、BlueField-4 DPU 和 Spectrum-X 以太网网络协同部署。也就是说,这笔投资不是临时起意,而是此前产品级合作的资本延伸。
如果这次投资最终落地,它的象征意义远大于财务意义:这是 GPU CUDA 生态第一次以股权绑定的方式,拥抱一家以存算一体为核心架构的 AI 芯片公司。
二、为什么是 d-Matrix:推理时代的 "内存墙"
要理解这笔投资的分量,需要回到 AI 芯片正在面临的核心矛盾。
过去数年,大模型训练的竞争逻辑很简单:堆算力、堆 GPU、堆集群。但当产业重心从训练转向规模化推理,新的瓶颈浮出水面 ——数据搬运。
在长上下文、多用户并发的推理场景下,模型权重、KV Cache 等数据规模急剧膨胀。即便计算单元拥有足够强的算力,如果数据无法及时供给,计算资源也只能空转。这就是行业常说的 "内存墙":问题不再是 "算不动",而是 "搬不动"。
传统架构的应对路径是提升带宽。HBM 通过先进封装把内存堆得离计算更近,带宽一路推到 8TB/s(B200 HBM3e)。但带宽提升有物理上限,当数据搬运本身成为系统开销,行业自然开始追问一个更底层的问题:能不能让计算发生在数据所在的地方?
d-Matrix 的答案是存算一体。其 DIMC 技术让存储块本身就是计算块,矩阵乘法在存储阵列内部完成,再通过嵌入的加法器树求和。Corsair 单卡集成 2GB 片上 SRAM,内存带宽高达 150 TB/s—— 远超 HBM。同时支持 256GB 片外 LPDDR5 扩展,按 MXINT8 精度提供 2.4 PFLOPS 算力,MXINT4 精度可达 9.6 PFLOPS。
这不是对 GPU 的替代,而是对推理负载的补位。d-Matrix 自己也很清楚:在训练领域,英伟达的地位已经难以撼动;但在推理这个对延迟、带宽和成本极度敏感的场景,专用架构有自己的生存空间。
三、"世纪握手":3D DRAM 与存算一体的合流
如果说 d-Matrix 的 DIMC 架构代表了存算一体的技术路线,那么其下一代 Raptor 平台引入的 3D DRAM 堆叠,则指向了另一个同样关键的趋势。
这里需要区分两个经常被混淆的概念:
3D 集成(含 3D DRAM)解决的是 "距离" 问题 —— 通过三维堆叠和高密度垂直互连,让计算裸片与存储裸片在物理层面尽可能靠近,缩短数据传输路径。存算一体解决的是 "效率" 问题 —— 在架构层面改变计算与存储的关系,消除缓存层级带来的数据搬运开销。
二者是不同层面的创新,但它们正在合流。
过去,3D 封装(如 HBM内部)主要服务于传统计算架构,本质上还是 "把内存搬到离计算更近的地方";而存算一体虽然架构激进,但受限于存储介质本身的容量和工艺,产品化路径曲折。当 3D DRAM 与存算一体结合,意味着物理层的 "近" 与架构层的 "融" 同时发生 —— 这恰好是对内存墙最直接的回应。
英伟达选择在这个节点投资 d-Matrix,且将其纳入 NVLink Fusion 体系,释放的产业信号非常明确:存算一体正在从架构研究走向产业化验证,而 3D DRAM 与存算一体的协同,正在成为下一代 AI 推理芯片的重要技术方向。
某种意义上,这可以被看作 GPU、CUDA 生态与 3D DRAM 存算一体架构之间的一次 "世纪握手" ——GPU 继续主导训练和通用计算,存算一体承接带宽敏感的推理负载,两者在同一个机架、同一张软件栈下分工协同。英伟达主动投资并开放 NVLink Fusion 入口,本质上是让 GPU 生态吸纳新型计算架构,而非被动等待它在体系外成长。
四、国内对标:谁在走同一条路?
英伟达在海外完成的这次布局,放在国内视角看,对应的问题是:有没有中国公司在沿同一条技术路线推进?
从公开信息来看,国内通用存算一体赛道中,同时满足以下几个条件的标的并不多 ——
走通用计算路线,而非局限于某一类特定加速场景(如视觉、加密);
软件栈兼容 CUDA 等主流生态,降低客户迁移成本;
技术路线涵盖 3D DRAM 与存算一体的协同设计,并推进产品化。
在这几个维度上,亿铸科技是国内起步最早、技术成熟度最高的一家。
根据其公开披露的信息,亿铸科技对存算一体的探索并非始于近期。早期研发阶段,公司已完成相关 AI 芯片的技术验证,并持续围绕计算架构、存储体系及软硬件协同开展工作。随着 AI 推理需求的演变,其技术路线进一步延伸至 3D DRAM 与通用存算一体架构的协同设计 —— 从计算架构、存储系统、互连方式到软件体系进行全链路优化,瞄准的是云端 AI 推理的产品化落地。
软件侧的选择同样关键。亿铸科技通过自研指令集、编译器、算子库,以及对 CUDA、PyTorch 等主流生态的兼容能力,构建面向通用 AI 计算的软件体系。这一思路与 d-Matrix 被纳入 NVLink Fusion 的逻辑高度一致:存算一体芯片要真正走进客户的部署清单,光有架构创新不够,必须让开发者能以最低成本迁移过来。
架构自洽、生态兼容、3D DRAM 产品化 —— 这三条线同时推进,在国内通用存算一体赛道中并不常见。
五、方向已经确认,异构协同成为新常态
英伟达投资 d-Matrix,本质上是给存算一体这条技术路线投了一张 "产业化确认票"。
在此之前,行业对存算一体的讨论长期停留在架构层面 —— 它能不能做、有没有用、会不会被 GPU 吞掉。英伟达用资本和生态两个维度同时给出答案:它不仅能用,而且值得被纳入 CUDA 主导的 AI 基础设施体系。
3D DRAM 与存算一体的结合,逻辑上已经自洽。物理层缩短距离,架构层消灭搬运,两层叠加正好命中推理时代的核心瓶颈。
国内市场的位置同样清晰。当海外已经由英伟达牵头完成生态对接,国内通用存算一体企业的任务不再是 "要不要走这条路",而是能否在架构创新之外,同步完成软件生态兼容和客户侧验证。亿铸科技这类从早期就锚定通用路线、并持续推进 CUDA 兼容与 3D DRAM 产品化的团队,已经走在正确的路径上。
AI 芯片的竞争,正在从 "谁的算力峰值更高" 转向 "谁的系统效率更优"。英伟达主动伸手与存算一体握手,是让 GPU 继续充当训练与通用计算的核心,同时把推理侧的带宽敏感负载交给存算一体承接 —— 把这场架构变革纳入自己主导的秩序之中。对整个行业而言,方向已经确认:GPU 与存算一体不是替代关系,而是同一张系统架构里的分工协同。
免责声明:
1、凡本网注明 '来源:大湾区经济网' 所有内容与数据,均属于大湾区经济网综合公开信息整理的数据(内容不构成投资建议,使用前请核实);欢迎转载、摘编使用上述作品,转载时应注明出处。
2、文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
3、本网所有的图片为政企或百度图库公开检索及配图,版权归原权利人和单位;如政企单位投稿所配的图片均默认授权给大湾区经济网,并有权使用和存用资料库中。
4、凡本网注明 '来源:XXX(非大湾区经济网)' 的,均转载自其它媒体或平台,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。
5、如涉及版权问题,请作者持权属证明联系侵删。
※ 欢迎上市公司、政府、商协会合作投稿,邮箱:dwqce@qq.com


