Featured image of post NVIDIA DGX Station 开卖:GB300 超级芯片与 748 GB 统一内存

NVIDIA DGX Station 开卖:GB300 超级芯片与 748 GB 统一内存

NVIDIA DGX Station 通过 OEM 渠道开卖,Exxact 报价 94,930 美元起。GB300 超级芯片集成 Blackwell Ultra GPU 与 72 核 Grace CPU,748 GB 统一内存,官方标称支持 1 万亿参数模型本地训练与推理。

8 月底,美国经销商 Exxact 挂出了 NVIDIA DGX Station 的整机报价。起售价 94,930 美元,顶配 108,350 美元,折合人民币 64 万到 74 万。

这是 NVIDIA 把数据中心级 Grace Blackwell 架构做成台式机的产物。GB300 超级芯片把 Blackwell Ultra GPU 和 72 核 Grace CPU 集成在单一封装里,通过 NVLink-C2C 互连形成 748 GB 统一内存,官方标称支持 1 万亿参数模型的本地训练与推理。

四款产品,名字相近

NVIDIA 在 2025 年 3 月的 GTC 同时发布了 DGX Spark 和 DGX Station,之后又补了两个变体,名字重叠,容易混淆。

产品 核心芯片 AI 算力(FP4) 统一内存 状态 起售价(美元)
DGX Spark GB10 1 PFLOPS 128 GB 2025 年 10 月上市 发布价 3,999,现价 4,699
DGX Station GB300 20 PFLOPS(稀疏)/ 15 PFLOPS 748 GB 2026 年 8 月经经销商开卖 94,930 起
DGX Station for Windows GB300 同上 748 GB 2026 年 5 月 31 日公告,规划中 未公布
RTX Spark MediaTek Kompanio + RTX 未公布 未公布 2026 年 5 月 31 日与 Microsoft 公告 未公布

DGX Spark 定位是桌面 agent 计算机(NVIDIA 官方页面标题用语),能做 2,000 亿参数以内的推理和 700 亿参数以内的微调,4 台通过网络互联可以处理 7,000 亿参数模型。DGX Station 定位是 deskside AI supercomputer,官方声称支持 1 万亿参数模型的本地训练与推理。两条产品线的分界线是内存容量,价格差着一个数量级。

价格:经销商挂价,NVIDIA 不公布定价

NVIDIA 不对 DGX Station 挂官方零售价,企业通过经销商按配置报价。目前公开挂出完整价单的是美国经销商 Exxact,其 Valence VWS-158270643 型号基于 MSI XpertStation WS300 主板。

配置 价格(美元) 备注
基础配置 94,930 标准整机
预设升级 96,316 提升存储容量
满配 108,350 加装 RTX PRO 6000 Blackwell 显卡、双 2 TB PCIe 5.0 SSD

8 月下旬美元兑人民币在 6.72 到 6.85 区间。起售价乘以强人民币汇率得 63.8 万,顶配价乘以年内均价得 74.2 万。

购买流程是企业级的:页面没有标准购物车,提交联系方式后由销售跟进,单次最多订 10 台,3 年保修。

GB300 超级芯片:一颗封装里的两颗计算单元

GB300 Grace Blackwell Ultra Desktop Superchip 把 Blackwell Ultra GPU 和 72 核 Grace CPU(Arm Neoverse V2 架构)集成在单一封装里。两颗计算单元之间用 NVLink-C2C 互连,带宽 900 GB/s,是第五代 PCIe 的 5 倍。

GPU 侧配 252 GB HBM3e 高带宽显存,带宽 7.1 TB/s,负责存储和运算模型的权重矩阵和中间激活值。CPU 侧配 496 GB LPDDR5X,带宽 396 GB/s,容量更大但带宽更低,通常用于系统内存、数据预处理和低频访问的模型参数。

两者在 NVLink-C2C 的打通下形成 748 GB 的统一内存(coherent memory,CPU 与 GPU 共享同一地址空间,数据不需要在显存和系统内存之间来回拷贝,搬移的延迟和带宽损失都由互连总线承担)。900 GB/s 的互连带宽意味着 GPU 向 CPU 侧内存读取数据的延迟和带宽,远低于传统 PCIe Gen 5 x16(64 GB/s)的方案,这直接关系到模型参数驻留在 CPU 侧内存时的推理速度。

传统工作站方案里,GPU 显存通常在 32 GB 到 96 GB 之间(RTX 4090 为 24 GB,RTX 6000 Ada 为 48 GB),系统内存则由 CPU 独占,两者之间隔着 PCIe 总线,带宽在几十 GB/s 量级。模型超过显存容量就要做量化(降低精度换取更小的内存占用)或者分层卸载(把模型的一部分放在系统内存,推理时按需搬到显存),两种手段都有性能代价:量化会损失精度,分层卸载会引入搬运延迟。

早期新闻稿(2025 年 3 月 18 日)写的是 784 GB of coherent memory,量产 Datasheet(2026 年 3 月版)定在 748 GB。规格在发布到量产之间做了下调,以 datasheet 为准。

748 GB 这个容量直接决定了模型能装多大。官方标称支持 1 万亿参数模型的本地训练与推理,不需要量化,不需要分层卸载。传统工作站方案的 GPU 显存通常在 32 GB 到 96 GB 之间,模型超过显存容量就要做量化或者分层卸载,两种手段都有性能代价。748 GB 统一内存的好处是把参数直接驻留在内存里,推理时不用在 CPU 和 GPU 之间搬运数据。

两台 DGX Station 用 QSFP112 线缆直连后,统一内存翻倍到 1.4 TB 以上,FP4 算力翻倍到 40 PFLOPS。Datasheet 原文:over 1.4 TB of coherent memory and up to 40 petaFLOPS。这个扩展能力让 DGX Station 不需要外部交换机就能组成双机集群,适合需要在 1 万亿参数以上规模做训练或长上下文推理的团队,不需要把任务提交到云端机房。

FP4 20 PFLOPS 的两个值

官方 Datasheet 的规格表里,FP4 Tensor Core 一栏写的是两个数字:20 PFLOPS 和 15 PFLOPS。

脚注 2 写明所有 Tensor Core 规格默认含稀疏加速(Sparsity,利用神经网络权重矩阵的结构性零值跳过乘法运算,理论有双倍吞吐提升)。脚注 3 标注不带稀疏。20 是带稀疏的峰值,15 是不带稀疏的峰值,两者差 1.33 倍。

官方宣传页取的就是 20 这个数字。中文媒体引用时大多没有标注条件。

以下是完整的精度表,全部来自 Datasheet,精度注明稀疏口径。

精度 算力 口径
FP4 Tensor Core 20 PFLOPS / 15 PFLOPS 带稀疏 / 不带稀疏
FP8 / FP6 Tensor Core 10 PFLOPS 带稀疏
Int8 330 TOPS 带稀疏
FP16 / BF16 5 PFLOPS 带稀疏
TF32 2.5 PFLOPS 带稀疏
FP32 80 TFLOPS 通用
FP64 1.3 TFLOPS 通用

一个观察:FP64 精度只保留了 1.3 TFLOPS,与 FP4 的 20 PFLOPS 差了四个数量级。对比上一代 H100 的 FP64 Tensor Core 67 TFLOPS 和 FP64 34 TFLOPS,GB300 架构把高精度计算资源大幅压缩,把晶体管预算让给了低精度推理。H100 的 FP64 是为科学计算和数值仿真设计的(流体力学、气象模拟、分子动力学),GB300 明确把这些工作负载排除在目标场景之外,把全部算力资源集中在 AI 推理上。

稀疏加速的适用范围也值得注意。并非所有模型都能吃到 2 倍稀疏红利。只有经过结构化稀疏训练或剪枝的模型才能利用硬件跳过零值的能力,未经处理的密集模型只能按 15 PFLOPS 的非稀疏算力计算。实际部署时,20 PFLOPS 的宣传数字需要模型侧配合才能兑现。

做算力对比时精度和稀疏口径必须对齐,否则中间会有 4 倍以上的换算误差。

整机:1600 W 功耗与液冷

整机功耗 1600 W,Datasheet 在 Total System Power 一栏直接标了这个数字,没有打折扣。

散热方面,ASUS 版本采用闭环 AIO(All-in-One,一体式水冷)方案,冷头直触 GPU 和 CPU,配合机箱风扇组成完整风道。ASUS 在新闻稿中的说法是零热节流(thermal throttling)的 24/7 满载运行设计。1600 W 功耗意味着这台机器的电费在 24 小时不间断运行时接近每天 4 度电,需要放在有足够供电和散热条件的地方,不能像普通台式机一样随意塞在桌下。

ET900N G3 内部,铜质液冷冷头与三联风扇模组(图源 ASUS 官网)

存储提供 4 个 M.2 PCIe Gen 5 插槽。PCIe 扩展槽有 1 个 PCIe Gen 5 x16 全速槽和 2 个 x16 外形(x8 电气)槽,官方支持加装一张 RTX PRO 6000(Workstation Edition 或 Max-Q 版)、RTX PRO 4000 SFF 或 RTX PRO 2000 显卡,用于可视化渲染和仿真类工作负载。

接口方面,中文报道称前面板没有任何 I/O,与 Datasheet 不符。Datasheet 明确列出前面板有 2 个 USB-C(USB 3.1)和 2 个 USB-A(USB 3.1)以及音频接口。

完整的接口清单如下。

位置 接口
前面板 2× USB-C(USB 3.1)、2× USB-A(USB 3.1)、音频
后面板 4× USB-A、USB Micro-B(BMC)、mini-DP(仅限 BMC 管理输出,接显示器无信号)、音频
网络 2× QSFP112(每口 400 Gb/s,峰值 800 Gb/s)、1× RJ45 10GbE、1× RJ45 1GbE(BMC 管理)

ET900N G3 正面,前面板接口与密纹进风格栅(图源 ASUS 官网)

ET900N G3 背部,扩展挡板、系统风扇与独立电源单元(图源 ASUS 官网)

后置 mini DisplayPort 的信号只通向 BMC(Baseboard Management Controller,带外管理控制器),普通用户不会用到。网络部分由 ConnectX-8 SuperNIC 提供,两台 DGX Station 直连时聚合带宽 800 Gb/s,可以把两台机器的内存和算力合并为一个资源池。

软件栈

出厂预装 Ubuntu 24.04 LTS 和 NVIDIA AI Developer Tools,CUDA-X 系列库全部预配置(cuDNN、TensorRT、NCCL、cuDF、cuML 等),NIM 微服务框架(NVIDIA Inference Microservices,预优化的推理服务模板,支持主流大模型一键部署)、DGX Dashboard、AI Workbench 开箱即用。软件栈顶层支持 Kubernetes 和 Run:ai 做集群调度,企业可另购 NVIDIA AI Enterprise 授权获得技术支持。

MIG(Multi-Instance GPU,多实例 GPU,单卡虚拟化技术)把 GPU 切分为最多 7 个隔离实例,每个实例有独立的显存、缓存和计算核心。一台机器分配给 7 个用户同时做独立的训练或推理任务,彼此互不干扰,服务质量有硬件级保障。

NemoClaw 是 NVIDIA 提供的开源参考栈,给 OpenClaw 加上隐私与安全控制的策略层(privacy and security guardrails),一条命令即可在本地部署常驻 AI 助手,不依赖云端资源。

ET900N G3 机身带 Ubuntu 与 NVIDIA 认证标识,45° 视角(图源 ASUS 官网)

OEM 机型与实测数据

NVIDIA 自己不卖整机,通过 OEM 出基于 DGX Station 架构的机器。

MSI XpertStation WS300 是第一款公开发布的 OEM 机型,2026 年 3 月 16 日发布,Exxact 挂价的 Valence VWS-158270643 就是基于它。ASUS ExpertCenter Pro ET900N G3 于 2026 年 6 月 15 日宣布上市,是目前公开过实测数据的机型。

ASUS 在新闻稿中给出的工程测试结果:用 vLLM 推理框架运行 Qwen 开源大模型,输出吞吐约 864 tokens/s,输入输出合计约 1,600 tokens/s。这是目前公开渠道唯一的第三方整机推理基准数据。

消费级显卡的显存带宽在 1 TB/s 量级(RTX 4090 为 1008 GB/s),7.1 TB/s 的 HBM3e 显存吞吐是它的 7 倍,加上 748 GB 的统一内存池,两者共同决定了能装下多大的模型和推理速度有多快。消费级显卡跑 70B 参数模型通常需要 4-bit 量化,推理速度在每秒几十个 token 的量级。DGX Station 不需要量化就能跑同等规模甚至更大的模型,ASUS 的实测数据(864 tokens/s)说明了差距有多大。

Dell、HP、Lambda、Supermicro、BOXX 等厂商也在 2025 年 GTC 的合作名单中,后续机型的上市节奏取决于各家 OEM 自己的安排。

参照系:DGX Spark 和 DGX Station 各管一段

DGX Spark DGX Station
核心芯片 GB10 GB300
FP4 算力 1 PFLOPS 20 PFLOPS(稀疏)/ 15 PFLOPS
统一内存 128 GB 748 GB
推理模型上限 2,000 亿参数 1 万亿参数
微调模型上限 700 亿参数 1 万亿参数
多机互联 最多 4 台,7,000 亿参数 2 台,1.4 TB+,40 PFLOPS
起售价 3,999 美元(发布时);2026 年 8 月涨至 4,699 美元 94,930 美元

DGX Spark 的发布价和 2026 年 8 月的实际购买价之间出现了 700 美元的涨幅,IntuitionLabs 2026 年 8 月 12 日更新的评测记录确认了这一变化。桌面 AI 硬件在发布后涨价属于少见事件,价格上调通常意味着供应链或需求侧的压力已经传导到终端。DGX Spark 搭载的 GB10 芯片和 GB300 同属 Grace Blackwell 家族,产能和定价都会受到整个产品线产能分配的影响。

DGX Station 当前是桌面统一内存的天花板,没有其他桌面机器达到 748 GB 的统一内存容量。这个容量解决的是模型能不能装进去的问题,决定了本地能跑多大的模型。

参考资料